中文

ReCast:用于生成式推荐的强化学习中重构学习信号

机器学习 2026-04-27 v1 人工智能 信息检索

摘要

通用组基于RL的假设是抽样得到的 rollout 组已经是可用的学习信号。我们指出,在稀疏命中生成式推荐中,这一假设不成立,因为许多抽样的组根本无法学习。我们提出了ReCast,一种修复-对比学习信号框架,首先为全零组恢复最小可学习性,然后将全组奖励归一化替换为以最强正样本和最难负样本为焦点的对比更新。ReCast保持外部RL框架不变,仅修改组内信号构建,部分解耦了 rollout 搜索宽度与actor侧更新宽度。在多个生成式推荐任务中,ReCast consistently 超过 OpenOneRec-RL,实现了最高36.6%的相对Pass@1提升。其匹配预算的优势显著更大:ReCast仅需 rollout 预算的4.1%即可达到基线的目标性能,而这一优势随模型规模而扩大。该设计同样带来了直接的系统级收益,将actor侧更新时间降低16.60倍,将峰值分配内存降低16.5%,提高actor MFU 14.2%。机制分析显示,ReCast 缓解了持续的全零/单命中状态,恢复稀缺自然正样本时的可学习性,并将本来被浪费的 rollout 预算转化为更稳定的策略更新。这些结果表明,对于生成式推荐而言,决定性RL问题不仅是如何分配奖励,更是如何从稀疏、结构化的监督中构建可学习的优化事件。

关键词

引用

@article{arxiv.2604.22169,
  title  = {ReCast: Recasting Learning Signals for Reinforcement Learning in Generative Recommendation},
  author = {Peiyan Zhang and Hanmo Liu and Chengxuan Tong and Yuxia Wu and Wei Guo and Yong Liu},
  journal= {arXiv preprint arXiv:2604.22169},
  year   = {2026}
}