随机过程(5):高斯过程(1): Gaussian is Everywhere
从这一节课开始,我们将深入研究高斯过程。这是一个非常重要的随机过程,在很多领域都有广泛的应用。
作为研究高斯过程的第一节课,我们主要希望向读者传达高斯过程在实际工程中的普遍性。我们将展示多个场景,每一个场景最终都能够归结到高斯过程上,从而展示我们研究高斯过程的意义和重要性。
一、扩散
首先,我们先从物理的角度上来谈谈扩散 (physical diffusion) 这个概念。值得一提的是,物理意义上的扩散和人工智能中的扩散模型其实本质上是一样的,这一点我们在后续的内容中会进行介绍,但在这一节中,我们主要关注与物理上的扩散过程。
扩散过程可以理解为:我们有一根粗细可以忽略的管子,其中充满了水。当我在水管的某个位置滴入一滴墨水,墨水分子会在水中逐渐地扩散。随着时间的推移,墨水分子在水中会形成某种分布。
我们可以想象,这个分布会是一个钟形曲线,中心区域的浓度较高,而边缘区域的浓度较低,这恰好和高斯分布的概率密度函数非常相似。
下面我们将通过对这个物理系统进行建模,严格地展示墨水分子扩散得到的分布就是高斯分布。
这个工作是爱因斯坦在1905年5月发表的题为《热的分子运动论所要求的静液体中悬浮粒子的运动》的论文提到的。也刚好是在这一年,他发表了狭义相对论和光电效应。
虽然相比于其他两个,这个工作的知名度要低很多,但它却也有非常深远的影响。因为这个工作首次从理性的角度看待了布朗运动,建立了布朗运动的统计理论模型,并帮助人们发现了分子的存在。
我们用一个二元函数
下面我们来描述这个粒子在水中的扩散过程。我们固定位置
其中,
公式 (1) 是对扩散的一种积分表达,这是一种典型的统计力学的方法,因为它并不是单独地对每个粒子进行研究,而是研究粒子的总数。
然而,这个积分方程比较难解。因此一种直观的想法是对
对于方程右边,我们对
Note:对右边的这种展开方式实际上理论上并不太严谨。因为积分变量
是从 到 ,而这个展开只有当 比较小的时候才是成立的。 然而,爱因斯坦还是采用了这种方式,并且理论推导的结果和实验观察高度一致。
我们舍去两边的高阶无穷小,公式 (1) 就变成了:
尽管在1905年,概率论的发展还基本没有起步,但爱因斯坦敏锐的提出,这里的
并且这个密度是关于
同时,其“方差”也可以被认为是一个常数
有了上述的条件,我们再代入公式 (4),就可以得到:
我们就得到了大名鼎鼎的扩散方程 (diffusion equation):
扩散方程有下面的边界条件:
这个方程的解形式为:
其中
这正好是一个高斯分布
二、信息论
一个随机变量
我们希望找到具有最大信息熵的随机变量
为了更好地研究这个问题,我们分别在三种条件下对最大熵问题进行求解。
2.1. 无限区间上的最大熵
在无限区间的条件下,我们约定:
- 分布区间为
。 - 均值为0:
。 - 方差是一个常数
: 。
我们的优化问题为:
这是一个泛函优化的问题,我们需要用到变分法 (variational method) 来求解。变分法最早来自于欧拉,是科学工程领域的一种基本方法。
我们记目标函数为
其中,
显然,由于
具体到我们这个问题中,
由于有约束条件,我们就需要用拉格朗日函数:
对
由于
由于
因此,
我们已经看到了最优解
综上所述,在无限区间的条件下,最大熵分布是一个高斯分布
2.2. 半无限区间上的最大熵
在半无限区间的条件下,我们约定:
- 分布区间为
。 - 均值是一个常数
: 。
在这个条件下,总体的方法和上面是基本相同的,我们也要使用变分法来求解。
只是拉格朗日函数中少了一个约束,此时变为:
求导之后我们得到:
由于
这表示在半无限区间上,最大熵分布是一个指数函数
2.3. 有限区间上的最大熵
在有限区间的条件下,我们约定:
- 分布区间为
。
由于没有约束条件,因此我们可以直接对
因此,在有限区间上,最大熵分布是一个均匀分布
三、随机变量之和的渐近行为分析
3.1. 中心极限定理
中心极限定理 (Central Limit Theorem, CLT) 是概率论中一个非常重要的定理,其内容如下:
设
当
Note:实际上,CLT不需要随机变量是 i.i.d. 的,也不需要均值为0、方差为1。我们这里只是为了方便证明,加上了这些形式。
下面,我们来证明中心极限定理。证明需要用到随机变量的特征函数,我们在附录1中介绍了特征函数的定义和用法,读者可以自行查阅。
考虑
其中,
代回原式得:
令
由于概率密度是特征函数的傅里叶反变换,因此我们可以知道:
中心极限定理得证。
3.2. 大数定理
大数定理 (Law of Large Numbers, LLN) 和中心极限定理都是研究大量随机变量所表现出的统计特性。
考虑一组 i.i.d. 的随机变量
也就是说当
用特征函数同样也能非常方便地证明大数定理。考虑
其中,
代回原式得:
令
因此,我们就得到结论:
3.3. 重对数律 (Kolmogorov)
对比CLT (25) 和LLN (31),我们可以发现仅仅是归一化因子的不同,二者的结论就会存在很大的差别。
- 在CLT中,我们用
对随机变量之和进行归一化,此时大量随机变量所表现出的复杂随机性会限制为一个高斯分布。 - 在LLN中,我们用
对随机变量之和进行归一化,此时随机性会被完全消除,变为一个常数。
更进一步地,我们希望对这个归一化因子的约束力度有一些更深刻的理解:在什么临界情况下,随机变量之和的随机性会刚好被消除?
重对数律 (Law of the Iterated Logarithm) 就是这个问题的一个深刻的解答。设
和
以概率1成立。
也就是说,使得随机变量之和的随机性完全消除的临界约束为
四、一维对称随机游动
随机游动 (random walk) 是随机过程中的一个重要话题。现在我们先考虑最简单的情况:一维对称随机游动。
假设我们把一维空间分为多个小格点,每个小格点的长度都是
考虑随机过程:
其中,
从上式可以看到,
我们希望研究当
这里可以看到,由于我们研究的是多个随机变量之和的行为,因此我们自然想到可以借用中心极限定理 (25) 来研究这个问题。
但是CLT是有应用条件的,它要求随机变量独立同分布,且均值为0方差为1。
在我们这个问题中,独立同分布是可以满足的,
但方差没办法满足。事实上:
因此我们要对
我们在保持
因此,一维对称随机游动也服从高斯分布。
此外我们还能看到,这个结果和第一节中扩散过程的结果 (10) 是一致的。扩散过程可以看作是一个宏观的统计结果,而随机游动则是一个微观的随机过程。因此,我们就能看到高斯分布在各种各样的情况中都广泛存在。
Appendix
Apd.1. 特征函数
对于一个随机变量
因此,我们可以进一步展开得:
也就是说,概率密度
特征函数特别适合用来分析随机变量之和,我们用下面这个例子来展示特征函数的用处。
对两个独立随机变量
纯概率论的证明
考虑
由于
因此,
利用特征函数的证明
考虑
由于特征函数和概率密度是一个傅里叶变换对,而频域上相乘等于时域上卷积,因此我们非常轻易就能知道