强化学习论文
变分序列级软策略优化(VESPO: Variational Sequence-Level Soft Policy Optimization for Stable Off-Policy LLM Training)
强化学习算法需要重要性采样来解决off-policy分布偏移的问题。传统的序列级重要性采样方式虽然理论上无偏,但面临着方差随序列长度指数级爆炸的问题。为此,本文提出了一种基于变分原理的软策略优化方法VESPO,通过将重要性权重塑形问题建模为在方差约束下的变分分布对齐问题,作者推导出了一个闭式解的塑形核函数。该方法无需长度归一化,直接在序列级操作,有效控制了方差。实验表明VESPO在高策略过时率和全异步训练设置下仍能保持稳定,并在MoE模型上取得了优于GRPO和GSPO的效果。
强化学习中的熵
RFT的熵动力学分析(On the Entropy Dynamics in Reinforcement Fine-Tuning of Large Language Models)
本文从理论角度分析了RFT(Reinforcement Fine-Tuning)过程中经常出现的熵坍塌 (Entropy Collapse) 现象。作者构建了一个描述token级别熵变化的理论模型,通过推导单个Logit更新对策略熵的一阶影响,提出了熵判别器分数(Entropy Discriminator Score)的核心概念。理论表明,策略熵的变化方向由更新方向与的判别器分数的符号共同决定。基于此,文章解释了为何奖励高置信度的答案会导致探索能力丧失,并统一了现有多种熵控制方法的理论解释。最后,作者提出了两种梯度截断算法,在不引入额外超参的情况下,有效缓解了熵坍塌现象,显著提升了模型在数学推理任务中的探索能力。
强化学习中的熵
强化学习中的熵 (2):熵安全策略
本文探讨了强化学习中的熵安全 (Policy Safety) 策略,介绍了在近期提出了双边熵安全策略。双边熵安全包括两个方面:1. 防止策略熵坍塌 (entropy collapse);2. 防止策略熵爆炸 (entropy explosion)。这些策略在实际应用中都有很好的效果,能够有效防止策略熵的不稳定,使得我们的模型具有更强的探索性,同时也能够保持模型的收敛性。
强化学习中的熵
强化学习中的熵 (1):策略熵
本文探讨了强化学习中的策略熵 (policy entropy),主要从理论上回答了两大问题:1. 为什么熵减往往意味着训练收敛;2. 策略梯度算法如何改变策略熵。从这两个问题的答案我们可以看出,策略梯度算法会导致策略熵的减小,从而使得策略收敛下来,这给了我们一个新的视角来看待强化学习的训练过程。