强化学习论文
自回归生成可以增强 dLLM 的探索性(The Flexibility Trap: Rethinking the Value of Arbitrary Order in Diffusion Language Models)
扩散语言模型 (dLLM) 可以以任意的顺序 (Arbitrary Order, AO) 生成 token,而不需要像自回归语言模型 (AR LLM) 那样严格地从左到右生成。理论上,这种以任意顺序生成 token 的能力使 dLLM 可以探索的解空间远比 AR LLM 更大。然而作者发现,随着采样次数变多,AR 却稳定优于 AO。在更高的采样预算下,AO 能够找到的解决方案几乎完全是 AR 的子集。这表明:看似灵活的方法实际上是在反复收敛于相同的几个解决方案,未能探索更加多样化推理路径。基于此,作者提出了一种用于 dLLM 的简单的后训练强化学习方法:JustGRPO。该方案的核心在于:在 RL 阶段强制 dLLM 严格按照从左到右的顺序来 rollout 和计算策略梯度,以此让 dLLM 的推理路径更加多样化。
强化学习论文
变分序列级软策略优化(VESPO: Variational Sequence-Level Soft Policy Optimization for Stable Off-Policy LLM Training)
强化学习算法需要重要性采样来解决off-policy分布偏移的问题。传统的序列级重要性采样方式虽然理论上无偏,但面临着方差随序列长度指数级爆炸的问题。为此,本文提出了一种基于变分原理的软策略优化方法VESPO,通过将重要性权重塑形问题建模为在方差约束下的变分分布对齐问题,作者推导出了一个闭式解的塑形核函数。该方法无需长度归一化,直接在序列级操作,有效控制了方差。实验表明VESPO在高策略过时率和全异步训练设置下仍能保持稳定,并在MoE模型上取得了优于GRPO和GSPO的效果。
强化学习论文
通过拟合整个奖励分布进行强化学习(FlowRL: Matching Reward Distributions for LLM Reasoning)
现有的RL方法都以最大化奖励为目标,这种导向在复杂推理任务中极易容易导致模式崩溃:即模型反复收敛至单一的成功推理路径,从而忽略了其他潜在的更优解或多样化的解法。FlowRL将强化学习的优化逻辑从“最大化奖励”改为“匹配奖励分布”,模型不再仅仅追逐单一的高分答案,而是致力于学习所有有效推理路径的概率分布,从而实现了更高效的探索,克服了以往RL方法中可能存在的模式坍缩问题。