--- doc_type: hypothesis-highlights url: 'https://mp.weixin.qq.com/s/kBdFFcoFhOBWsPiR50s7ow' --- # 我从未见过如此全面的Transformer剖析 ## Metadata - Title: 我从未见过如此全面的Transformer剖析 - Reference: https://mp.weixin.qq.com/s/kBdFFcoFhOBWsPiR50s7ow - Category: #source/article🗞 - Tags: ## Highlights - Transformer架构的优点在于它完全摈弃了传统的循环结构,取而代之的是只通过注意力机制来计算模型输入与输出的隐含表示,而这种注意力的名字就是大名鼎鼎的自注意力机制(self-attention),也就是图1-2中的Multi-Head Attention模块 - 所谓自注意力机制就是通过某种运算来直接计算得到句子在编码过程中每个位置上的注意力权重;然后再以权重和的形式来计算得到整个句子的隐含向量表示。 - 1.2 技术手段 - 1.2.1 什么是self-Attention - 所谓的自注意力机制其实就是论文中所指代的“Scaled Dot-Product Attention“ - 自注意力机制的核心过程就是通过Q和K计算得到注意力权重;然后再作用于V得到整个权重和输出 - 对于输入Q、K和V来说,其输出向量的计算公式为:其中Q、K和V分别为3个矩阵,且其(第2个)维度分别为 (从后面的计算过程其实可以发现。而公式(1.1)中除以的过程就是图1-3中所指的Scale过程。之所以要进行缩放这一步是因为通过实验作者发现,对于较大的来说在完成后将会得到很大的值,而这将导致在经过sofrmax操作后产生非常小的梯度,不利于网络的训练。