Update from Sync Service
This commit is contained in:
@@ -0,0 +1,30 @@
|
||||
---
|
||||
doc_type: hypothesis-highlights
|
||||
url: 'https://www.zhihu.com/tardis/zm/art/366993073?source_id=1003'
|
||||
---
|
||||
# additive attention与dot-product attention
|
||||
|
||||
## Metadata
|
||||
|
||||
- Title: additive attention与dot-product attention
|
||||
|
||||
- Reference: https://www.zhihu.com/tardis/zm/art/366993073?source_id=1003
|
||||
|
||||
- Category: #source/article🗞
|
||||
|
||||
- Tags:
|
||||
|
||||
## Highlights
|
||||
|
||||
- “加型注意力机制”与“点积型注意力机制”最大的区别就是解码器隐状态与编码器输出的编码的交互过程,也就是两者关系大小的评估过程。在这里传统编码-解码结构使用了一个全连接神经网络结构,意味着两者的关系是加和的关系。因为我们知道全连接神经网络的公式是 ,如果将解码器的隐状态 和编码器每一步的隐状态 分别视作全连接神经网络的 和 的话,计算公式显然为 ,显然这里解码器隐状态与编码器输出编码的交互方式为加和。
|
||||
|
||||
|
||||
|
||||
- 矩阵 和矩阵 、 的交互为矩阵的乘积,所以这里解码器隐状态与编码器输出编码的交互方式为乘积。
|
||||
|
||||
|
||||
|
||||
- 根据Transformer论文的说法,加型注意力机制和点乘注意力机制有着相同的计算复杂度,但点乘注意力机制运算可以使用高度优化的并行矩阵乘法代码,会更快也更节省空间。
|
||||
|
||||
|
||||
|
||||
@@ -0,0 +1,5 @@
|
||||
在注意力机制中,key是用于参考的信息,通常是由Encoder产生的表示数据,它与查询向量(query)共同用于计算当前位置下上下文向量(context vector)的权重。对于原始输出的key(比如,CNN中的feature map),往往需要通过一些变换(如一个全连接层)将维度缩小,以通过query和key之间的相似度计算了解关注的位置。
|
||||
|
||||
具体来说,Encoder中的输出通常是一个二维矩阵,其维度为[batch_size, hidden_size],其中hidden_size表示representation的大小。当我们将Encoder的输出作为key时,首先需要为key定义权重向量(weight vector),来描述当前query与key的相似度。由于key的输入维度至少是hidden_size才能提取出有意义的信息,因此通常会将hidden_size的维度扩展至2倍,即2*hidden_size。
|
||||
|
||||
这种做法的主要目的是增加模型的表达能力,通过增加key的维度,可以更好地捕捉到query和key之间的暗示关系,进而提高模型的性能。同时,这种做法也可以通过增加参数数量使模型更加复杂。不过对于使用不同类型的Encoder或Decoder,key维度(或其他变换操作)可能会有所改变,具体操作以实际模型为准。
|
||||
@@ -0,0 +1,46 @@
|
||||
---
|
||||
doc_type: hypothesis-highlights
|
||||
url: 'https://mp.weixin.qq.com/s/kBdFFcoFhOBWsPiR50s7ow'
|
||||
---
|
||||
# 我从未见过如此全面的Transformer剖析
|
||||
|
||||
## Metadata
|
||||
|
||||
- Title: 我从未见过如此全面的Transformer剖析
|
||||
|
||||
- Reference: https://mp.weixin.qq.com/s/kBdFFcoFhOBWsPiR50s7ow
|
||||
|
||||
- Category: #source/article🗞
|
||||
|
||||
- Tags:
|
||||
|
||||
## Highlights
|
||||
|
||||
- Transformer架构的优点在于它完全摈弃了传统的循环结构,取而代之的是只通过注意力机制来计算模型输入与输出的隐含表示,而这种注意力的名字就是大名鼎鼎的自注意力机制(self-attention),也就是图1-2中的Multi-Head Attention模块
|
||||
|
||||
|
||||
|
||||
- 所谓自注意力机制就是通过某种运算来直接计算得到句子在编码过程中每个位置上的注意力权重;然后再以权重和的形式来计算得到整个句子的隐含向量表示。
|
||||
|
||||
|
||||
|
||||
- 1.2 技术手段
|
||||
|
||||
|
||||
|
||||
- 1.2.1 什么是self-Attention
|
||||
|
||||
|
||||
|
||||
- 所谓的自注意力机制其实就是论文中所指代的“Scaled Dot-Product Attention“
|
||||
|
||||
|
||||
|
||||
- 自注意力机制的核心过程就是通过Q和K计算得到注意力权重;然后再作用于V得到整个权重和输出
|
||||
|
||||
|
||||
|
||||
- 对于输入Q、K和V来说,其输出向量的计算公式为:其中Q、K和V分别为3个矩阵,且其(第2个)维度分别为 (从后面的计算过程其实可以发现。而公式(1.1)中除以的过程就是图1-3中所指的Scale过程。之所以要进行缩放这一步是因为通过实验作者发现,对于较大的来说在完成后将会得到很大的值,而这将导致在经过sofrmax操作后产生非常小的梯度,不利于网络的训练。
|
||||
|
||||
|
||||
|
||||
@@ -0,0 +1,7 @@
|
||||
1. 卖出:
|
||||
1. 可能性1: 如下组合可能出现顶部,需要出货,上升趋势中,MACD红柱子缩短,KDJ死叉,OBV开始下滑;
|
||||
2. ~~可能性2: 如下组合可能出现顶部,上升趋势中,MACD红柱子开始缩短,DMI的DI线开始下降(或者是MACD红柱子虽然上升但是DMI的DI线开始下降),KDJ接近死叉,MFI也开始下降(尤其从80之上到80之下);~~
|
||||
3. 可能性3: 可能性1构成的指标可能会被洗出去,考虑引入expma指标,在满足可能性1的前提下,如果股价跌穿MA1线则卖出,如果KDJ指标中k线仅略低于d线,且expma未跌穿MA1线,则继续持有;**要注意这个组合过于不敏感,如果成本较高,且市场情绪一般,还是优先考虑可能性1;**
|
||||
2. 买入:
|
||||
1. 可能性1:如下组合可以考虑买入,横盘后,MACD金叉或二次金叉,OBV线上穿MAOBV线,KDJ金叉或接近金叉;— 较为滞后,可以作为追涨的指标;
|
||||
2. 可能性2:MACD绿柱缩短,且KDJ金叉,MFI持续上升,可以作为建立底仓的信号,该组合出现后仍可能振荡整理之后再上升,所以仓位不可太重;
|
||||
@@ -0,0 +1,4 @@
|
||||
1. 考虑引入cci指标:
|
||||
1. 当cci较前两日均上行,且kdj交叉,且收盘价站上5日线,买入;
|
||||
2. cci在100以上时不卖出;
|
||||
3. 当cci从100以上落入100以下,且kdj死叉,收盘价跌破5日线,卖出;
|
||||
Reference in New Issue
Block a user