--- doc_type: hypothesis-highlights url: 'https://www.zhihu.com/tardis/zm/art/366993073?source_id=1003' --- # additive attention与dot-product attention ## Metadata - Author: [zhihu.com]() - Title: additive attention与dot-product attention - Reference: https://www.zhihu.com/tardis/zm/art/366993073?source_id=1003 - Category: #source/article🗞 - Tags: ## Highlights - “加型注意力机制”与“点积型注意力机制”最大的区别就是解码器隐状态与编码器输出的编码的交互过程,也就是两者关系大小的评估过程。在这里传统编码-解码结构使用了一个全连接神经网络结构,意味着两者的关系是加和的关系。因为我们知道全连接神经网络的公式是 ,如果将解码器的隐状态 和编码器每一步的隐状态 分别视作全连接神经网络的 和 的话,计算公式显然为 ,显然这里解码器隐状态与编码器输出编码的交互方式为加和。 - 矩阵 和矩阵 、 的交互为矩阵的乘积,所以这里解码器隐状态与编码器输出编码的交互方式为乘积。 - 根据Transformer论文的说法,加型注意力机制和点乘注意力机制有着相同的计算复杂度,但点乘注意力机制运算可以使用高度优化的并行矩阵乘法代码,会更快也更节省空间。