#过程奖励模型

共 1 篇文章

搜广推论文

利用PRM监督生成式推荐模型(PROMISE: Process Reward Models Unlock Test-Time Scaling Laws in Generative Recommendations)

利用PRM监督生成式推荐模型的中间解码步骤,并由此获得test-time scaling的能力,在推理阶段仅需增加少量计算量就能稳定提升性能。