中文

PROMISE:过程奖励模型解锁生成式推荐中的测试时缩放定律

信息检索 2026-01-09 v1

摘要

生成式推荐已成为一种极具前景的范式,将推荐重新表述为在层次化 Semantic ID 上的序列到序列生成任务。然而,现有方法存在一个我们称之为语义漂移的关键问题,即早期高层 token 中的错误会不可逆地将生成轨迹偏转到不相关的语义子空间。受在大型语言模型中增强推理的过程奖励模型启发,我们提出了 Promise,一个将密集的、逐步验证集成到生成模型中的新颖框架。Promise 具有一个轻量级 PRM 来评估中间推理步骤的质量,并结合了利用密集反馈来动态剪枝错误分支的 PRM 引导的 Beam Search 策略。至关重要的是,我们的方法解锁了推荐系统的测试时缩放定律:通过增加推理计算量,较小的模型可以匹配或超越较大的模型。在大规模平台上的广泛离线实验和在线 A/B 测试表明,Promise 有效缓解了语义漂移,显著提升了推荐准确性,同时实现了高效部署。

关键词

引用

@article{arxiv.2601.04674,
  title  = {PROMISE: Process Reward Models Unlock Test-Time Scaling Laws in Generative Recommendations},
  author = {Chengcheng Guo and Kuo Cai and Yu Zhou and Qiang Luo and Ruiming Tang and Han Li and Kun Gai and Guorui Zhou},
  journal= {arXiv preprint arXiv:2601.04674},
  year   = {2026}
}