Files
obsidian_sycn/知识管理/additive attention与dot-product attention.md
T
2026-07-31 15:28:08 +08:00

1.3 KiB

doc_type, url
doc_type url
hypothesis-highlights https://www.zhihu.com/tardis/zm/art/366993073?source_id=1003

additive attention与dot-product attention

Metadata

Highlights

  • “加型注意力机制”与“点积型注意力机制”最大的区别就是解码器隐状态与编码器输出的编码的交互过程,也就是两者关系大小的评估过程。在这里传统编码-解码结构使用了一个全连接神经网络结构,意味着两者的关系是加和的关系。因为我们知道全连接神经网络的公式是 ,如果将解码器的隐状态 和编码器每一步的隐状态 分别视作全连接神经网络的 和 的话,计算公式显然为 ,显然这里解码器隐状态与编码器输出编码的交互方式为加和。

  • 矩阵 和矩阵 、 的交互为矩阵的乘积,所以这里解码器隐状态与编码器输出编码的交互方式为乘积。

  • 根据Transformer论文的说法,加型注意力机制和点乘注意力机制有着相同的计算复杂度,但点乘注意力机制运算可以使用高度优化的并行矩阵乘法代码,会更快也更节省空间。