随机过程(5):高斯过程(1): Gaussian is Everywhere

从这一节课开始,我们将深入研究高斯过程。这是一个非常重要的随机过程,在很多领域都有广泛的应用。

作为研究高斯过程的第一节课,我们主要希望向读者传达高斯过程在实际工程中的普遍性。我们将展示多个场景,每一个场景最终都能够归结到高斯过程上,从而展示我们研究高斯过程的意义和重要性。

一、扩散

首先,我们先从物理的角度上来谈谈扩散 (physical diffusion) 这个概念。值得一提的是,物理意义上的扩散和人工智能中的扩散模型其实本质上是一样的,这一点我们在后续的内容中会进行介绍,但在这一节中,我们主要关注与物理上的扩散过程。

扩散过程可以理解为:我们有一根粗细可以忽略的管子,其中充满了水。当我在水管的某个位置滴入一滴墨水,墨水分子会在水中逐渐地扩散。随着时间的推移,墨水分子在水中会形成某种分布。

我们可以想象,这个分布会是一个钟形曲线,中心区域的浓度较高,而边缘区域的浓度较低,这恰好和高斯分布的概率密度函数非常相似。

下面我们将通过对这个物理系统进行建模,严格地展示墨水分子扩散得到的分布就是高斯分布。

这个工作是爱因斯坦在1905年5月发表的题为《热的分子运动论所要求的静液体中悬浮粒子的运动》的论文提到的。也刚好是在这一年,他发表了狭义相对论和光电效应。

虽然相比于其他两个,这个工作的知名度要低很多,但它却也有非常深远的影响。因为这个工作首次从理性的角度看待了布朗运动,建立了布朗运动的统计理论模型,并帮助人们发现了分子的存在。

我们用一个二元函数 来表征系统在时间 、在位置 处的粒子数量。

下面我们来描述这个粒子在水中的扩散过程。我们固定位置 ,考察在经过一段时间 后,粒子数量的变化。我们知道这个变化肯定来源于其他地方的粒子进入 ,又或者是 中的粒子去到其他地方。因此,这个地方的粒子数量的改变量就是在 这段时间内,每一个位置 上的粒子数量的改变量的总和:

(1)

其中, 是在位置 处经过时间 运动到位置 的粒子数量的比例。

公式 (1) 是对扩散的一种积分表达,这是一种典型的统计力学的方法,因为它并不是单独地对每个粒子进行研究,而是研究粒子的总数。

然而,这个积分方程比较难解。因此一种直观的想法是对 进行展开,因为时间间隔 是一个很小的区间。对于方程左边:

(2)

对于方程右边,我们对 进行展开:

(3)

Note:对右边的这种展开方式实际上理论上并不太严谨。因为积分变量 是从 到 ,而这个展开只有当 比较小的时候才是成立的。

然而,爱因斯坦还是采用了这种方式,并且理论推导的结果和实验观察高度一致。

我们舍去两边的高阶无穷小,公式 (1) 就变成了:

(4)

尽管在1905年,概率论的发展还基本没有起步,但爱因斯坦敏锐的提出,这里的 可以看作是某种概率密度。因为 是在时间 内,从位置 运动到位置 的粒子数量的比例,爱因斯坦认为,这种比例应当能够被归一化,也就是某种概率密度:

(5)

并且这个密度是关于 对称的,即:

(6)

同时,其“方差”也可以被认为是一个常数 :

(7)

有了上述的条件,我们再代入公式 (4),就可以得到:

(8)

我们就得到了大名鼎鼎的扩散方程 (diffusion equation):

(9)

扩散方程有下面的边界条件:,表示在时间 时,粒子数量分布是一个 delta 函数,即只有在位置 处有粒子,其他位置的粒子数量都是 。

这个方程的解形式为:

(10)

其中 。

这正好是一个高斯分布 。

二、信息论

一个随机变量 的信息熵定义为:

(11)

我们希望找到具有最大信息熵的随机变量 。

为了更好地研究这个问题,我们分别在三种条件下对最大熵问题进行求解。

2.1. 无限区间上的最大熵

在无限区间的条件下,我们约定:

  1. 分布区间为 。
  2. 均值为0: 。
  3. 方差是一个常数 : 。

我们的优化问题为:

(12)

这是一个泛函优化的问题,我们需要用到变分法 (variational method) 来求解。变分法最早来自于欧拉,是科学工程领域的一种基本方法。

我们记目标函数为 ,假设最优解为 ,则我们构造新函数 :

(13)

其中, 是一个实数而非函数, 是任取的关于 的函数。

显然,由于 是 的最优解,因此对 进行任何的扰动都会去到一个较小的值。也就是说, 在 取得最大值:,即 。

具体到我们这个问题中, 的表达式为:

(14)

由于有约束条件,我们就需要用拉格朗日函数:

(15)

对 求导得:

(16)

由于 是一个驻点,因此上式在 时等于0,即:

(17)

由于 的任意性,说明:

(18)

因此,

(19)

我们已经看到了最优解 是一个指数二次型函数,这是一个高斯分布的典型特征。

综上所述,在无限区间的条件下,最大熵分布是一个高斯分布 。

2.2. 半无限区间上的最大熵

在半无限区间的条件下,我们约定:

  1. 分布区间为 。
  2. 均值是一个常数 : 。

在这个条件下,总体的方法和上面是基本相同的,我们也要使用变分法来求解。

只是拉格朗日函数中少了一个约束,此时变为:

(20)

求导之后我们得到:

(21)

由于 是任意的,因此:

(22)

这表示在半无限区间上,最大熵分布是一个指数函数 。

2.3. 有限区间上的最大熵

在有限区间的条件下,我们约定:

  1. 分布区间为 。

由于没有约束条件,因此我们可以直接对 求导,得到:

(23)

因此,在有限区间上,最大熵分布是一个均匀分布 。

三、随机变量之和的渐近行为分析

3.1. 中心极限定理

中心极限定理 (Central Limit Theorem, CLT) 是概率论中一个非常重要的定理,其内容如下:

设 是一组均值为0、方差为1,且 i.i.d. 的随机变量。考虑随机变量:

(24)

当 时,无论 是什么分布, 都趋向于服从标准正态分布 :

(25)

Note:实际上,CLT不需要随机变量是 i.i.d. 的,也不需要均值为0、方差为1。我们这里只是为了方便证明,加上了这些形式。

下面,我们来证明中心极限定理。证明需要用到随机变量的特征函数,我们在附录1中介绍了特征函数的定义和用法,读者可以自行查阅。

考虑 的特征函数:

独立同分布(26)

其中,

(27)

代回原式得:

(28)

令 :

(29)

由于概率密度是特征函数的傅里叶反变换,因此我们可以知道:

(30)

中心极限定理得证。

3.2. 大数定理

大数定理 (Law of Large Numbers, LLN) 和中心极限定理都是研究大量随机变量所表现出的统计特性。

考虑一组 i.i.d. 的随机变量 ,我们有:

(31)

也就是说当 足够大时, 的随机性会完全消失,变为一个确定的数 。

用特征函数同样也能非常方便地证明大数定理。考虑 的特征函数:

(32)

其中,

(33)

代回原式得:

(34)

令 :

(35)

因此,我们就得到结论:

(36)

3.3. 重对数律 (Kolmogorov)

对比CLT (25) 和LLN (31),我们可以发现仅仅是归一化因子的不同,二者的结论就会存在很大的差别。

  • 在CLT中,我们用 对随机变量之和进行归一化,此时大量随机变量所表现出的复杂随机性会限制为一个高斯分布。
  • 在LLN中,我们用 对随机变量之和进行归一化,此时随机性会被完全消除,变为一个常数。

更进一步地,我们希望对这个归一化因子的约束力度有一些更深刻的理解:在什么临界情况下,随机变量之和的随机性会刚好被消除?

重对数律 (Law of the Iterated Logarithm) 就是这个问题的一个深刻的解答。设 是一组均值为0、方差为 ,且 i.i.d. 的随机变量,重对数律断言:

(37)

和

(38)

以概率1成立。

也就是说,使得随机变量之和的随机性完全消除的临界约束为 。

四、一维对称随机游动

随机游动 (random walk) 是随机过程中的一个重要话题。现在我们先考虑最简单的情况:一维对称随机游动。

假设我们把一维空间分为多个小格点,每个小格点的长度都是 。

考虑随机过程:

(39)

其中,。 服从两点分布:

(40)

从上式可以看到, 只能往两个方向移动,因此是一维的。又因为往左和往右是等概率的,因此是对称的。

我们希望研究当 且 时,在某一个时间 上随机变量 的分布。

这里可以看到,由于我们研究的是多个随机变量之和的行为,因此我们自然想到可以借用中心极限定理 (25) 来研究这个问题。

但是CLT是有应用条件的,它要求随机变量独立同分布,且均值为0方差为1。

在我们这个问题中,独立同分布是可以满足的, 显然是 i.i.d. 的。均值为0也可以满足,因为 以等概率取 或 。

但方差没办法满足。事实上:

(41)

因此我们要对 进行归一化,让它符合中心极限定理的形式:

(42)

我们在保持 的前提下同时令 ,。此时,

(43)

因此,一维对称随机游动也服从高斯分布。

此外我们还能看到,这个结果和第一节中扩散过程的结果 (10) 是一致的。扩散过程可以看作是一个宏观的统计结果,而随机游动则是一个微观的随机过程。因此,我们就能看到高斯分布在各种各样的情况中都广泛存在。

Appendix

Apd.1. 特征函数

对于一个随机变量 ,其特征函数 (characteristic function) 的定义为:

(44)

因此,我们可以进一步展开得:

(45)

也就是说,概率密度 和特征函数 是一个傅里叶变换对。又由于 ,根据Bochner定理,我们立马能够知道 是一个正定函数。

特征函数特别适合用来分析随机变量之和,我们用下面这个例子来展示特征函数的用处。

对两个独立随机变量 ,则这两个随机变量之和 的概率密度就是这两者概率密度的卷积:。

纯概率论的证明

考虑 的累积分布函数:

(46)

由于 和 相互独立,因此这个条件可以忽略:

(47)

因此, 的概率密度函数为:

(48)

利用特征函数的证明

考虑 的特征函数:

(49)

由于特征函数和概率密度是一个傅里叶变换对,而频域上相乘等于时域上卷积,因此我们非常轻易就能知道 。