1.3 KiB
1.3 KiB
doc_type, url
| doc_type | url |
|---|---|
| hypothesis-highlights | https://www.zhihu.com/tardis/zm/art/366993073?source_id=1003 |
additive attention与dot-product attention
Metadata
-
Title: additive attention与dot-product attention
-
Reference: https://www.zhihu.com/tardis/zm/art/366993073?source_id=1003
-
Category: #source/article🗞
-
Tags:
Highlights
-
“加型注意力机制”与“点积型注意力机制”最大的区别就是解码器隐状态与编码器输出的编码的交互过程,也就是两者关系大小的评估过程。在这里传统编码-解码结构使用了一个全连接神经网络结构,意味着两者的关系是加和的关系。因为我们知道全连接神经网络的公式是 ,如果将解码器的隐状态 和编码器每一步的隐状态 分别视作全连接神经网络的 和 的话,计算公式显然为 ,显然这里解码器隐状态与编码器输出编码的交互方式为加和。
-
矩阵 和矩阵 、 的交互为矩阵的乘积,所以这里解码器隐状态与编码器输出编码的交互方式为乘积。
-
根据Transformer论文的说法,加型注意力机制和点乘注意力机制有着相同的计算复杂度,但点乘注意力机制运算可以使用高度优化的并行矩阵乘法代码,会更快也更节省空间。