Update from Sync Service

This commit is contained in:
FNS Service
2026-07-31 15:28:08 +08:00
commit b8a78631a4
569 changed files with 193313 additions and 0 deletions
@@ -0,0 +1,134 @@
## 1. 盲源分析(BSS)
1. 盲源分离指在完全不知道任何先验知识或者只知道少量先验知识的情况下,只利用观测信号提取或分离出各个源信号的方法[[#^f9e7f7]]
3. 这里的“盲”是指:1.源信号是不可观测的;2.混合系统是事先未知的。
4. 常用方法:
1. 独立分量分析(ICA)
2. 熵最大化方法
3. 非线性主分量分析
> 可以证明,独立分量分析和熵最大化方法是等价的[[#^f9e7f7]]
## 2. 概览
### 2.1 用途
ICA是BSS的一种常用方法,用于从观测信号中提取或分离原始信号;
### 2.2 基本原理
根据中心极限定理,对于混合信号,其概率密度比任何一个源信号的概率分布都接近高斯分布;反过来,最大化信号的非高斯性与最大化信号的统计独立性是一致的,这是ICA的基本原理[[#^62f060]]。
### 2.3 前提
使用ICA分离原始信号时,应满足以下前提[[#^7903a9]]
1. 独立性,即原始信号是相互独立的;
2. 非高斯性,即原始信号不服从高斯分布,换言之,ICA无法提取混合信号中符合高斯分布的原始信号;
3. 复杂性,即混合信号的复杂度应大于所有的原始信号;
## 4. 独立性评估方法[[#^7903a9]]
ICA有三种评估分量独立性的方法:1. 基于非高斯度;2. 基于互信息度;3. 基于最大似然估计;
### 4.1 基于非高斯度的方法
ICA常用峭度和负熵来衡量独立分量的非高斯度:
1. 峭度(Kurtosis): 峭度可以用来评估信号的非高斯度,因此通过寻找让峭度最大的矩阵来提取混合的信号;基于峭度的方法优点是容易计算,但是峭度对异常值十分敏感,因此该方法的鲁棒性不高。峭度(K)定义如下:
$$
K= E[x^4]-3(E[x^2])^2
$$
2. 负熵(Negative entropy): 由信息论理论可知,在所有等方差的随机变量中,高斯变量的熵最大,所以可以利用熵来度量非高斯性。一般采用熵的修正形式——负熵来评价独立成分的非高斯度,根据中心极限定理,当一个随机变量是许多相互独立的随机变量之和时,如果这些随机变量具有有限的均值和方差,那么这个随机变量越接近高斯分布[[#^bff01c]]。因此,当独立成分分离的负熵达到最大时,说明完成各独立成分的分离。负熵(J)的定义如下:
$$
J(y)=H(y_{Gaussian})-H(y))
$$
其中,$H(y_{Garussian})$代表协方差矩阵与y相同的高斯变量的熵;
> 应注意,负熵永远是非负值,因为在协方差相同的条件下,高斯分布具有最大的熵,当且仅当所有变量均服从高斯分布时,负熵为0;
### 4.2 基于互信息度的方法
互信息是一种用于衡量两个随机变量之间相互依赖程度的指标。给定两个随机变量X和Y,它们的互信息I(X;Y)定义为它们联合概率分布p(x,y)与它们各自的边缘概率分布p(x)和p(y)之间的差异,其定义为:
$$
I(X,Y)=H(X)-H(X|Y)=H(Y)-H(Y|X)
$$
其中,H(X)和H(Y)分别是X和Y的熵,H(X|Y)和H(Y|X)分别是在给定Y和X的条件下X和Y的条件熵。互信息的值越大,表示两个变量之间的相互依赖程度越高,反之则越低。
在ICA中,互信息用于衡量两个分离出来的信号之间的独立性程度。基于互信息的方法通过最小化互信息来获取独立成分。
### 4.3 基于最大似然估计的方法
基于最大似然估计的方法和基于互信息度的方法本质上是等价的,仅相差符号和一个常数;应该注意到,如果关于独立分量的先验知识是错误的,那么最大似然估计可能会给出错误的结果,但是基于非高斯度的方法并不需要任何先验知识。
### 4.4 迭代缩减
非高斯性测量指标可以使得独立成分的逐个估计成为可能,这是互信息或似然方法所不能实现的。在ICA中,通常使用一种称为“迭代缩减”(deflationary)的方法,该方法一次估计一个独立成分。在每一次迭代中,使用非高斯性测量指标来选择最不高斯的信号作为下一个独立成分。这种方法通常比同时估计所有独立成分的方法更有效。
与互信息或似然方法相比,使用非高斯性测量指标具有更好的性质。互信息和似然方法通常需要一次性估计所有的独立成分,因此可能存在估计过程中的交叉干扰,导致估计结果不准确。而使用非高斯性测量指标则可以逐个估计独立成分,避免了这种交叉干扰,提高了估计的准确性。
在ICA中,通过最小化独立成分的峭度或最大化独立成分的负熵来选择最不高斯的信号作为下一个独立成分。
## 5. 常用算法
### 5.1 投影追踪(Projection pursuit)
1. 投影追寻是一种用于寻找多维数据可能投影的统计学方法,在基本的一维投影追寻中,其目标是寻找一些列投影方向,在这些方向上,数据分布尽可能的偏离高斯分布,而这于ICA的目标一致,因此,ICA也会被认为是投影追寻的一个变种。
2. 投影追寻中,独立分量是逐个被提取出来的。通过不断重复寻找使非高斯度最大的投影方向来逐个提取独立分量。这种方法被称为紧缩。
3. 其步骤如下:
1. 初始化:选择一个随机的投影向量w,然后归一化该向量,得到w。
2. 投影:将高维信号X投影到一维空间中,得到一个一维向量y,y=X^Tw。
3. 非高斯性度量:对y进行非高斯性度量,如负熵,得到一个标量g。
4. 梯度更新:利用g对w进行梯度更新,w=w+μg∇w g,其中μ为学习率,∇w g为g对w的梯度。这一步更新后,再对w进行归一化。
5. 收敛判断:对步骤2~4进行迭代,直到w的变化很小或者达到最大迭代次数,判断算法是否收敛。
6. 得到ICA模型:迭代结束后,得到的投影向量w即为一组独立成分,将该向量与原始数据矩阵X相乘,即可得到ICA模型。
### 5.2 FastICA
1. FastICA算法通过一种固定点迭代的策略来最大化非高斯度从而提取独立分量;
2. FastICA次或至少二次收敛速度,因此它比基于比梯度算法的线性收敛快得多;
3. FastICA算法没有学习率或其他任何需要调整的参数,因此容易使用;
4. 其步骤如下:
1. 初始化:随机初始化投影矩阵W。
2. 分离:使用一个迭代算法来更新W,以最大化非高斯性度量(如峭度或负熵),使得独立成分被逐个分离出来。
3. 旋转:由于FastICA中提取的独立成分的顺序和符号是不确定的,需要进行旋转来确定它们的顺序和符号。常用的方法是正交化或者正交矩阵分解。
4. 重构:将分离出来的独立成分重构成原始数据。
5. FastICA是一个迭代算法,它需要设定停止条件;
## 6. 预处理
ICA需要两步的预处理:
1. 中心化
2. 白化
## 7. 不确定性
ICA不能唯一确定分离结果,其不确定性包括[[#^374d36]]
1. 不能确定独立成分的方差或者说能量:因为变换矩阵A和原始信号s都是未知的,s缩放的倍数可以在A上补偿回来。因此我们统一假设各独立分量的方差为1。其实,这样假设之后仍然存在一个不确定性,独立分量乘以-1并不影响方差。不过在实际应用时,并不影响。
2. 不能确定各独立分量的顺序:同样,由于变换矩阵A和原始信号s都是未知的,在预测时我们可以任意改变A和s对应分量的位置,在矩阵运算中就是乘以一个置换矩阵。
## 7. 优缺点
### 7.1 优点[[#^46c57e]]
1. 收敛速度快。
2. 并行和分布计算,要求内存小,易于使用。
3. 能通过使用一个非线性函数g便能直接找出任何非高斯分布的独立分量。
4. 能够通过选择一个适当的非线性函数g而使其达到最佳化。特别是能得到最小方差的算法。
5. 仅需要估计几个(不是全部)独立分量,能极大地减小计算量。
### 7.2 缺点
1. ICA 的结果具有一定的不确定性,因为独立成分的顺序和符号是未知的。这就需要对结果进行后处理,例如通过交叉验证选择最优的解。
2. ICA 对于数据的要求较高,需要假设数据是相互独立的,并且每个独立成分必须是非高斯分布。如果数据不符合这些要求,ICA的效果可能会受到影响。
3. ICA 计算复杂度较高,对于大规模数据的处理需要更多的计算资源和时间。
4. ICA 是一种线性模型,对于非线性的混合模型,其效果可能不如其他非线性模型,例如深度学习模型。
### 参考文献
1. [[盲源分离——理论、应用与展望]] ^f9e7f7
2. [[Independent component analysisAn introduction]] ^7903a9
3. [独立成分分析(Independent component analysis, ICA)](https://www.cnblogs.com/ytxwzqin/p/9675217.html) ^62f060
4. [ICA独立成分分析—FastICA基于负熵最大](https://blog.csdn.net/zb1165048017/article/details/48464573) ^bff01c
5. [尝试理解ICAIndependent Component Analysis)独立成分分析](https://blog.csdn.net/u014485485/article/details/78452820) ^374d36
6. [人工智能–ICA算法](https://cloud.tencent.com/developer/news/197255) ^46c57e
@@ -0,0 +1,17 @@
## 1. AARRR海盗模型
海盗模型是用户分析的经典模型,它反映了增长是系统性地贯穿于用户生命周期各个阶段:
A 拉新(Acquisition):  通过各种推广渠道,以各种方式获取目标用户,并对各种营销渠道的效果评估,不断优化投入策略,降低获客成本。
- 涉及关键指标例如 新增注册用户数、激活率、注册转化率、新客留存率、下载量、安装量等,我们通过这些指标就可反应出获取目标用户的效果是怎样的。
A 活跃(Activation):活跃用户指真正开始使用了产品提供的价值,我们需要掌握用户的行为数据,监控产品健康程度。这个模块主要反映用户进入产品的行为表现,是产品体验的核心所在。
- 涉及关键指标例如 DAU/MAU 、日均使用时长、启动APP时长、启动APP次数等。通过这些指标可以反映出用户的活跃情况。
R 留存(Retention):衡量用户粘性和质量的指标。涉及关键指标例如 留存率、流失率等。通过这些指标可以反映出用户的留存情况。
R 变现(Revenue): 主要用来衡量产品商业价值。涉及关键指标例如 生命周期价值(LTV)、客单价、GMV等。这些指标可以反映出产品的商业价值。
R 推荐(Referral):衡量用户自传播程度和口碑情况。涉及关键指标例如 邀请率、裂变系数等。
@@ -0,0 +1,30 @@
---
doc_type: hypothesis-highlights
url: 'https://mengte.online/archives/1879'
---
# Spearman相关性分析(Spearman Correlation Analysis)——理论介绍 - 梦特医数通
## Metadata
- Title: Spearman相关性分析(Spearman Correlation Analysis)——理论介绍 - 梦特医数通
- Reference: https://mengte.online/archives/1879
- Category: #source/article🗞
- Tags:
## Highlights
- 先将变量X、Y分别从小到大排序编秩,用秩次RX和RY表示。排序时,出现数据相等从而造成秩次相同的现象称为相持(tie),此时,取其平均秩次为每个数据的秩次
- Spearman相关性分析,需要满足2个条件: 条件1:变量包含等级变量、或变量不服从正态分布或分布类型未知。 条件2:两变量之间存在单调关系。
- Spearman相关,又称秩相关、等级相关,是对两变量的秩次大小作线性相关分析,对原始变量的分布不作要求,属于非参数统计方法,适用范围较广。对于服从Pearson相关的数据亦可计算Spearman相关系数,但统计效能更低。 Spearman相关系数(rs)介于-1与1之间,rs >0为正相关,rs <0为负相关。rs的绝对值(|rs|)越大,变量间的相关性越强。 参考Pearson相关系数对rs进行等级划分:当0.9</r/<1,为高度相关;当0.7</r/<0.9,为强相关;0.4</r/<0.7,为中度相关;0.2</r/<0.4,为弱相关性;0</r/<0.2,为极弱相关或无相关性。
@@ -0,0 +1,22 @@
---
doc_type: hypothesis-highlights
url: 'https://juejin.cn/post/7195433939593330749'
---
# 斯皮尔曼相关(spearman)相关性分析一文详解+python实例代码 - 掘金
## Metadata
- Title: 斯皮尔曼相关(spearman)相关性分析一文详解+python实例代码 - 掘金
- Reference: https://juejin.cn/post/7195433939593330749
- Category: #source/article🗞
- Tags:
## Highlights
- 斯皮尔曼相关系数的适用条件比皮尔逊相关系数要广,只需两个变量的观测值是成对的等级评定数据,或者是由连续变量观测数据转化得到的等级数据,不论两个变量的总体分布形态、样本容量的大小如何,都可以用斯皮尔曼等级相关系数来进行研究。只要数据满足单调关系(例如线性函数、指数函数、对数函数等)就能够使用。
@@ -0,0 +1,22 @@
---
doc_type: hypothesis-highlights
url: 'https://juejin.cn/post/7195433939593330749'
---
# 斯皮尔曼相关(spearman)相关性分析一文详解+python实例代码 - 掘金
## Metadata
- Title: 斯皮尔曼相关(spearman)相关性分析一文详解+python实例代码 - 掘金
- Reference: https://juejin.cn/post/7195433939593330749
- Category: #source/article🗞
- Tags:
## Highlights
- 斯皮尔曼相关系数的适用条件比皮尔逊相关系数要广,只需两个变量的观测值是成对的等级评定数据,或者是由连续变量观测数据转化得到的等级数据,不论两个变量的总体分布形态、样本容量的大小如何,都可以用斯皮尔曼等级相关系数来进行研究。只要数据满足单调关系(例如线性函数、指数函数、对数函数等)就能够使用。
@@ -0,0 +1,26 @@
---
doc_type: hypothesis-highlights
url: 'https://juejin.cn/post/7196290097549361209'
---
# 皮尔逊相关性分析一文详解+python实例代码 - 掘金
## Metadata
- Title: 皮尔逊相关性分析一文详解+python实例代码 - 掘金
- Reference: https://juejin.cn/post/7196290097549361209
- Category: #source/article🗞
- Tags:
## Highlights
- 总结一下对于皮尔逊相关系数的使用场景,有三种必要的特性使用皮尔逊系数最佳: 连续数据 正态分布 线性关系
- 上述三个条件均满足才能使用pearson相关系数,否则就用spearman相关系数。定序数据之间也只用spearman相关系数,不能用pearson相关系数。
@@ -0,0 +1,26 @@
---
doc_type: hypothesis-highlights
url: 'https://juejin.cn/post/7196290097549361209'
---
# 皮尔逊相关性分析一文详解+python实例代码 - 掘金
## Metadata
- Title: 皮尔逊相关性分析一文详解+python实例代码 - 掘金
- Reference: https://juejin.cn/post/7196290097549361209
- Category: #source/article🗞
- Tags:
## Highlights
- 总结一下对于皮尔逊相关系数的使用场景,有三种必要的特性使用皮尔逊系数最佳: 连续数据 正态分布 线性关系
- 上述三个条件均满足才能使用pearson相关系数,否则就用spearman相关系数。定序数据之间也只用spearman相关系数,不能用pearson相关系数。
@@ -0,0 +1,37 @@
---
doc_type: hypothesis-highlights
url: 'https://juejin.cn/post/7187943854141046839'
---
## Metadata
- Title: 肯德尔系数相关性分析一文详解+python实例代码 - 掘金
- Reference: https://juejin.cn/post/7187943854141046839
- Category: #source/article🗞
- Tags:
## Highlights
- Kendall(肯德尔)系数的定义:n个同类的统计对象按特定属性排序,其他属性通常是乱序的。同序对(concordant pairs)和异序对(discordant pairs)之差与总对数(n*(n-1)/2)的比值定义为Kendall(肯德尔)系数。
- 肯德尔相关则是基于样本数据对之间的关系来进行相关系数的强弱的分析,数据对可以分为一致对(Concordant)和分歧对(Discordant)。
- 变量数据是有序的( ordinal) 或者是连续的(continuous. 有序尺度(Ordinal scales )的数据通常用于用数值的方式来衡量非数值的概念
- 连续尺度的数据就勿需解释了,常见的温度啊、体重啊、收入啊等等都(或严格、或近似)算是连续尺度的数据。
- 肯德尔系数有两个计算公式,一个称为Tau-c,另一个称为Tau-b。两者的区别是Tau-b可以处理有相同值的情况,即并列排位(tied ranks)。
@@ -0,0 +1,37 @@
---
doc_type: hypothesis-highlights
url: 'https://juejin.cn/post/7187943854141046839'
---
## Metadata
- Title: 肯德尔系数相关性分析一文详解+python实例代码 - 掘金
- Reference: https://juejin.cn/post/7187943854141046839
- Category: #source/article🗞
- Tags:
## Highlights
- Kendall(肯德尔)系数的定义:n个同类的统计对象按特定属性排序,其他属性通常是乱序的。同序对(concordant pairs)和异序对(discordant pairs)之差与总对数(n*(n-1)/2)的比值定义为Kendall(肯德尔)系数。
- 肯德尔相关则是基于样本数据对之间的关系来进行相关系数的强弱的分析,数据对可以分为一致对(Concordant)和分歧对(Discordant)。
- 变量数据是有序的( ordinal) 或者是连续的(continuous. 有序尺度(Ordinal scales )的数据通常用于用数值的方式来衡量非数值的概念
- 连续尺度的数据就勿需解释了,常见的温度啊、体重啊、收入啊等等都(或严格、或近似)算是连续尺度的数据。
- 肯德尔系数有两个计算公式,一个称为Tau-c,另一个称为Tau-b。两者的区别是Tau-b可以处理有相同值的情况,即并列排位(tied ranks)。
@@ -0,0 +1,62 @@
## 1. 皮尔逊相关性分析
### 1.1 使用条件
1. 连续变量
2. 正态分布
3. 线性相关
### 1.2 定义
皮尔逊相关系数定义为两个变量的协方差和标准差的商。
1. 对于总体:
$$
\rho=\frac{cov(X,Y)}{\sigma_X\sigma_Y}=\frac{E[(X-\mu_X)(Y-\mu_Y)]}{\sigma_X\sigma_Y}
$$
2. 对于样本:
$$
r=\frac{\sum_{i=1}^{n}{(X_i-\overline{X})(Y_i-\overline{Y})}}{\sqrt{\sum_{i=1}^n(X_i-\overline{X})^2}\sqrt{\sum_{i=1}^n{(Y_i-\overline{Y})}}}
$$
### 1.3 判定方法
使用皮尔逊相关系数需要验证变量满足连续、符合正态分布并且为线性相关关系,其中,正态分布和线性相关需要验证。
1. 正态分布
可以使用KS检验来验证变量是否符合正态分布;
2. 线性相关
一般通过散点图验证;
## 2. 斯皮尔曼相关性分析
### 2.1 使用条件
1. 成对的等级评定数据或由连续变量转化来的等级数据;
### 2.2 定义
斯皮尔曼相关系数可定义为等级变量的皮尔逊相关系数
$$
\rho=\frac{\sum_i{(x_i-\overline{x})(y_i-\overline{y})}}{\sqrt{\sum_i{(x_i-\overline{x})^2}\sum_i{(y_i-\overline{y})^2}}}
$$
其中,$x_i、y_i、\overline{x}、\overline{y}$均为等级数据,对于连续变量转化的等级数据,如有两个值相等,则在所在位置取算术平均值。
## 3. 肯德尔相关性分析
### 3.1 使用条件
1. 数据是有序的或连续的尺度信息;
2. 两个变量之间遵循单调关系;
### 3.2 定义
肯德尔相关性分析定义为,两个样本数据之间同序对,异序对的差与总对数的商;
$$
\tau=\frac{C-D}{\frac{1}{2}n(n-1)}
$$
其中,C为同序对的数量;
D为异序对的数量;
n为样本量;