Transformer
Introcution
用于机器翻译
---------------------
Inputs -> |Encoders -> Decoders| -> Outputs
---------------------首先将 words 分成 tokens。
遇到的第一个矩阵 Embedding Matrix,代表了单词库,每个单词是向量的一列,叫做
Unembedding Matrix 与 Embedding 含义类似,行列对调。叫做
Softmax 用于对概率进行归一化。Softmax with temperature,效果是当 T 较大时,给低值赋予更多权重。
Attention
Attention 将互相不关联的向量联系起来。当经过多层 Attention 后预测后一个 token 的生成将完全基于序列中的最后一个向量。
Single Head Attention
一个向量和其他向量进行关联,这样被编码为了另一组向量,叫做 Query ,
引入第三个矩阵,Value Matrix 乘前面的结果,得到值向量,用于给嵌入向量增加相关性信息。
Value Matrix 参数量很大,将其化为两个矩阵相乘(Low Rank 低秩分解)。Output 矩阵实际上就是把 Value 矩阵拆解的结果。
Multi-Head Attention
每个 Attention 都有不同 Q, K, V。多头 Attention 可以使模型学习到根据上下文来改变语义的多种方式。