Soft Actor-Critic 算法分析
Soft Actor-Critic 算法分析。
共 10 篇文章
Soft Actor-Critic 算法分析。
扩散语言模型 (dLLM) 可以以任意的顺序 (Arbitrary Order, AO) 生成 token,而不需要像自回归语言模型 (AR LLM) 那样严格地从左到右生成。理论上,这种以任意顺序生成 token 的能力使 dLLM 可以探索的解空间远比 AR LLM 更大。然而作者发现,随着采样次数变多,AR 却稳定优于 AO。在更高的采样预算下,AO 能够找到的解决方案几乎完全是 AR 的子集。这表明:看似灵活的方法实际上是在反复收敛于相同的几个解决方案,未能探索更加多样化推理路径。基于此,作者提出了一种用于 dLLM 的简单的后训练强化学习方法:JustGRPO。该方案的核心在于:在 RL 阶段强制 dLLM 严格按照从左到右的顺序来 rollout 和计算策略梯度,以此让 dLLM 的推理路径更加多样化。
强化学习算法需要重要性采样来解决off-policy分布偏移的问题。传统的序列级重要性采样方式虽然理论上无偏,但面临着方差随序列长度指数级爆炸的问题。为此,本文提出了一种基于变分原理的软策略优化方法VESPO,通过将重要性权重塑形问题建模为在方差约束下的变分分布对齐问题,作者推导出了一个闭式解的塑形核函数。该方法无需长度归一化,直接在序列级操作,有效控制了方差。实验表明VESPO在高策略过时率和全异步训练设置下仍能保持稳定,并在MoE模型上取得了优于GRPO和GSPO的效果。
本文从理论角度分析了RFT(Reinforcement Fine-Tuning)过程中经常出现的熵坍塌 (Entropy Collapse) 现象。作者构建了一个描述token级别熵变化的理论模型,通过推导单个Logit更新对策略熵的一阶影响,提出了熵判别器分数(Entropy Discriminator Score)的核心概念。理论表明,策略熵的变化方向由更新方向与的判别器分数的符号共同决定。基于此,文章解释了为何奖励高置信度的答案会导致探索能力丧失,并统一了现有多种熵控制方法的理论解释。最后,作者提出了两种梯度截断算法,在不引入额外超参的情况下,有效缓解了熵坍塌现象,显著提升了模型在数学推理任务中的探索能力。
现有的RL方法都以最大化奖励为目标,这种导向在复杂推理任务中极易容易导致模式崩溃:即模型反复收敛至单一的成功推理路径,从而忽略了其他潜在的更优解或多样化的解法。FlowRL将强化学习的优化逻辑从“最大化奖励”改为“匹配奖励分布”,模型不再仅仅追逐单一的高分答案,而是致力于学习所有有效推理路径的概率分布,从而实现了更高效的探索,克服了以往RL方法中可能存在的模式坍缩问题。
本文探讨了强化学习中的动态规划 (Dynamic Programming, DP) 算法,DP算法是一种用于求解MDP问题的最优策略的一系列算法,其核心思想在于:利用价值函数来指导和描述能够得到最优策略的搜索方法。文中详细介绍了两种非常经典的DP算法:策略迭代和值迭代,这是现代强化学习算法的基石。最后,文章通过引入巴拿赫不动点理论,从数学上严格证明了DP算法的收敛性。
本文探讨了强化学习中的有限马尔可夫过程 (Finite Markov Decision Process) 的基本概念和数学建模。文中深入介绍了强化学习中一些非常重要的概念和定义,比如说:策略、价值函数、贝尔曼方程、最优策略等,是理解所有强化学习算法的基础。
本文探讨了强化学习中的熵安全 (Policy Safety) 策略,介绍了在近期提出了双边熵安全策略。双边熵安全包括两个方面:1. 防止策略熵坍塌 (entropy collapse);2. 防止策略熵爆炸 (entropy explosion)。这些策略在实际应用中都有很好的效果,能够有效防止策略熵的不稳定,使得我们的模型具有更强的探索性,同时也能够保持模型的收敛性。
本文探讨了强化学习中的策略熵 (policy entropy),主要从理论上回答了两大问题:1. 为什么熵减往往意味着训练收敛;2. 策略梯度算法如何改变策略熵。从这两个问题的答案我们可以看出,策略梯度算法会导致策略熵的减小,从而使得策略收敛下来,这给了我们一个新的视角来看待强化学习的训练过程。
本文探讨了强化学习中的多臂赌博机模型,包括如何估计动作价值函数(即Q值)、如何选择下一个动作、如何利用梯度方法求解最优策略等。本文作为强化学习基础系列的开篇,读者可以从中感受到强化学习的基本思想以及理论框架。