生成式推荐系统中的预测解码加速
系统介绍生成式推荐系统中预测解码(Speculative Decoding)技术的最新进展,涵盖 AtSpeed (ICLR'25)、LASER (SIGIR'25)、NEZHA (WWW'26) 和 SpecGR (AAAI'26) 四项代表性工作。
共 5 篇文章
系统介绍生成式推荐系统中预测解码(Speculative Decoding)技术的最新进展,涵盖 AtSpeed (ICLR'25)、LASER (SIGIR'25)、NEZHA (WWW'26) 和 SpecGR (AAAI'26) 四项代表性工作。
使用LLM对个性化搜索进行语义增强时会遇到Knowledge-Action Gap问题。LLM 预训练获得的丰富语义知识与个性化任务中的判别性目标存在内在冲突。淘宝团队提出了KARMA,将语义重建作为训练时的正则化器,让表征不仅能与用户行为对齐,还能保持语义可解码性。
利用PRM监督生成式推荐模型的中间解码步骤,并由此获得test-time scaling的能力,在推理阶段仅需增加少量计算量就能稳定提升性能。
将优化目标与AUC指标对齐、多目标之间相互对齐。1. 与AUC指标对齐的端到端排序优化:利用可微分排序直接端到端地优化多目标AUC总和,不需要使用间接的分类或回归的代理损失。2. 两阶段多目标集成范式:将原有的单步集成范式改进为两阶段的Align-and-Emsemble的新范式,显式建模不同目标(购买、评论、关注等)之间的共享排序能力。
使用一个 Transformer 模块统一建模非序列特征(特征交叉)和序列特征(序列建模),使得两种特征可以更好地交互,并且借助 LLM 的各种优化手段(kv cache、flash attention、混合精度训练、激活值重计算等)减少推理延迟。