#扩散语言模型

共 1 篇文章

强化学习论文

自回归生成可以增强 dLLM 的探索性(The Flexibility Trap: Rethinking the Value of Arbitrary Order in Diffusion Language Models)

扩散语言模型 (dLLM) 可以以任意的顺序 (Arbitrary Order, AO) 生成 token,而不需要像自回归语言模型 (AR LLM) 那样严格地从左到右生成。理论上,这种以任意顺序生成 token 的能力使 dLLM 可以探索的解空间远比 AR LLM 更大。然而作者发现,随着采样次数变多,AR 却稳定优于 AO。在更高的采样预算下,AO 能够找到的解决方案几乎完全是 AR 的子集。这表明:看似灵活的方法实际上是在反复收敛于相同的几个解决方案,未能探索更加多样化推理路径。基于此,作者提出了一种用于 dLLM 的简单的后训练强化学习方法:JustGRPO。该方案的核心在于:在 RL 阶段强制 dLLM 严格按照从左到右的顺序来 rollout 和计算策略梯度,以此让 dLLM 的推理路径更加多样化。