强化学习中的熵 (1):策略熵

引言

策略熵 (policy entropy) 是强化学习中非常重要的一个概念,它衡量了当前策略决策时的不确定性。

对于离散的动作空间 ,策略 在状态 的熵定义为:

(1)

进一步地,如果 是一个softmax policy,则

(2)

其中, 是logits系数。

在利用强化学习(特别是PG算法)训练一个softmax策略时,很容易出现熵坍塌的现象,即在训练早期策略熵很快收敛,导致采样效率很低,难以获得有效的监督信号进一步提升能力。

本文将从两个方面论证这一点:

  1. 为什么熵减往往意味着训练收敛
  2. 策略梯度更新如何改变策略熵

一、为什么熵减意味着训练收敛

Reference

Theorem 1. 给定一个softmax策略 ,有如下结论成立

(3)

其中, 表示 的2阶Renyi熵。

公式中定义的熵称为香农熵,也是1阶Renyi熵。由于Renyi熵关于阶数是单调不增的,即,因此我们有

(4)

定理1说明了,一个softmax策略在状态 处的策略梯度的范数与策略熵的变化方向相同。即当策略熵越小,策略梯度的范数就越小,也就是训练趋于收敛。

下面的定理2从另外一个角度说明了这个事情。

Theorem 2. 假设策略 经过一次更新后,得到新策略 。这两个策略的KL散度存在上界:

(5)

其中 表示两个策略在同一个状态 处的logits向量之差,即

(6)

观察公式右侧的第一项,我们有如下结论:

  1. logits差的无穷范数(即logits变化最大的action)越小,新旧策略整体的KL变化幅度越小。
  2. 当策略熵接近0,新旧策略的差异也接近0。

在附录中展示了这两个定理的详细证明,有兴趣的读者可以自行查看。

二、熵动力学分析

Reference: 《The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models》

在这一章中,我们定量分析了策略熵在一次梯度更新前后的变化量。最终,我们能得到下面两个结论:

  1. 对于softmax策略,策略熵的变化取决于每个动作的【对数概率】和【logits变化量】的协方差
  2. 如果策略是按照PG算法来更新的,则【logits变化量】正比于每个动作的【优势】

用更通俗的语言来表述上面两个结论就是:

  • 高概率 + 高优势 动作 --> 熵减
  • 低概率 + 高优势 动作 --> 熵增

这是符合直觉的。因为熵表示了模型的自信程度,如果模型发现一个低概率的动作能获得很高的优势,他会发现自己做错了,也就变得更不自信。

下面我们用更加形式化的语言来描述这两个结论。

Theorem 3 (softmax策略熵的变化). 给定一个softmax策略 ,在相邻两次的更新步中,二者的熵的变化量满足下面的一阶近似:

(7)

Theorem 4 (PG算法下的策略熵变化). 在定理3的条件下,若按照策略梯度算法进行更新,则有如下进一步的结论:

(8)

其中, 表示动作 在状态 下的优势。

附录

定理1的证明

Definition (Renyi熵). 对于离散随机变量 ,设其概率分布为 ,则 阶Renyi熵的定义为:

(9)

不难发现,香农熵就是在 时的Renyi熵,即。

Proof of Theorem 1.

简化一下定理1中的符号表达,我们希望证明的是如下等式成立:

(10)

其中, 是一个softmax策略,即:

(11)

我们首先推导得到梯度策略的范数的表达式。考察单个动作 策略梯度我们有:

(12)

因此,我们有

(13)

对所有动作求期望得:

(14)

证明完毕。

Renyi熵单调性的证明

Lemma (Renyi熵的阶数单调性). Renyi熵关于阶数 是单调不减的,即

(15)

Proof of Lemma. 我们定义如下的对数矩生成函数

(16)

因此Renyi熵可以表示为:。

下面我们证明 是一个凸函数。令 ,我们有

(17)

最后一步的不等式是利用了Jensen不等式。

凸函数的一个重要性质为:割线斜率关于右端点单调不减,即对于任意的 ,我们有

(18)

对于任意的,我们定义切线斜率:

(19)

则 是一个单调递增函数,因此 单调递减。

定理2的证明

首先简化一下记号。我们记策略向量 。定义向量函数 。

将 在 处进行二阶泰勒展开,我们有:

(20)

其中 。

关于函数 ,我们有如下三个等式成立:

(21)

其中, 是策略在logits向量 处的Fisher信息矩阵,即:

(22)

其中 。

为了证明逻辑的连续性,我们在这里不具体证明这三个等式。具体的证明已经放到最后。

将上述的等式代入泰勒展开中,得到:

(23)

其中,

(24)

其中第一个不等式是利用了 Cauchy-Schwarz 不等式,最后一个不等号是定理1的结论。

至此,定理2得证。

一阶导数证明

对 的形式做等价变形得:

(25)

对 求偏导得:

(26)

当 时,,因此 得证。

二阶导数证明

一个经典结论是:KL散度 在 处的Hessian矩阵等于Fisher信息矩阵。下面我们证明这一点。

对一阶导数再次求导得:

(27)

代入 得

(28)

得证。

定理3的证明

对策略熵 在 处进行一阶泰勒展开,并代入 得:

(29)

下面我们推导 的形式:

(30)

代入上式得

(31)

得证。

定理4的证明

在定理3的基础上,我们只需要证明以下引理,即可得到定理4。

Lemma. 给定一个softmax策略,并按照PG算法进行一步更新,则 的变化量满足:

(32)

Proof of Lemma.

(33)

其中,

(34)

因此,

(35)

得证。