强化学习中的熵 (1):策略熵
引言
策略熵 (policy entropy) 是强化学习中非常重要的一个概念,它衡量了当前策略决策时的不确定性。
对于离散的动作空间
进一步地,如果
其中,
在利用强化学习(特别是PG算法)训练一个softmax策略时,很容易出现熵坍塌的现象,即在训练早期策略熵很快收敛,导致采样效率很低,难以获得有效的监督信号进一步提升能力。
本文将从两个方面论证这一点:
- 为什么熵减往往意味着训练收敛
- 策略梯度更新如何改变策略熵
一、为什么熵减意味着训练收敛
Reference
- https://zhuanlan.zhihu.com/p/1950579532802270647
- 《Harnessing Uncertainty: Entropy-Modulated Policy Gradients for Long-Horizon LLM Agents》
Theorem 1. 给定一个softmax策略
其中,
公式
定理1说明了,一个softmax策略在状态
下面的定理2从另外一个角度说明了这个事情。
Theorem 2. 假设策略
其中
观察公式
- logits差的无穷范数(即logits变化最大的action)越小,新旧策略整体的KL变化幅度越小。
- 当策略熵接近0,新旧策略的差异也接近0。
在附录中展示了这两个定理的详细证明,有兴趣的读者可以自行查看。
二、熵动力学分析
Reference: 《The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models》
在这一章中,我们定量分析了策略熵在一次梯度更新前后的变化量。最终,我们能得到下面两个结论:
- 对于softmax策略,策略熵的变化取决于每个动作的【对数概率】和【logits变化量】的协方差
- 如果策略是按照PG算法来更新的,则【logits变化量】正比于每个动作的【优势】
用更通俗的语言来表述上面两个结论就是:
- 高概率 + 高优势 动作 --> 熵减
- 低概率 + 高优势 动作 --> 熵增
这是符合直觉的。因为熵表示了模型的自信程度,如果模型发现一个低概率的动作能获得很高的优势,他会发现自己做错了,也就变得更不自信。
下面我们用更加形式化的语言来描述这两个结论。
Theorem 3 (softmax策略熵的变化). 给定一个softmax策略
Theorem 4 (PG算法下的策略熵变化). 在定理3的条件下,若按照策略梯度算法进行更新,则有如下进一步的结论:
其中,
附录
定理1的证明
Definition (Renyi熵). 对于离散随机变量
不难发现,香农熵就是在
Proof of Theorem 1.
简化一下定理1中的符号表达,我们希望证明的是如下等式成立:
其中,
我们首先推导得到梯度策略的范数的表达式。考察单个动作
因此,我们有
对所有动作求期望得:
证明完毕。
Renyi熵单调性的证明
Lemma (Renyi熵的阶数单调性). Renyi熵关于阶数
Proof of Lemma. 我们定义如下的对数矩生成函数
因此Renyi熵可以表示为:
下面我们证明
最后一步的不等式是利用了Jensen不等式。
凸函数的一个重要性质为:割线斜率关于右端点单调不减,即对于任意的
对于任意的
则
定理2的证明
首先简化一下记号。我们记策略向量
将
其中
关于函数
其中,
其中
为了证明逻辑的连续性,我们在这里不具体证明这三个等式。具体的证明已经放到最后。
将上述的等式代入泰勒展开中,得到:
其中,
其中第一个不等式是利用了 Cauchy-Schwarz 不等式,最后一个不等号是定理1的结论。
至此,定理2得证。
一阶导数证明
对
对
当
二阶导数证明
一个经典结论是:KL散度
对一阶导数再次求导得:
代入
得证。
定理3的证明
对策略熵
下面我们推导
代入上式得
得证。
定理4的证明
在定理3的基础上,我们只需要证明以下引理,即可得到定理4。
Lemma. 给定一个softmax策略,并按照PG算法进行一步更新,则
Proof of Lemma.
其中,
因此,
得证。