中文

Climber-Pilot:面向更好指令遵循的非即时生成式推荐模型

信息检索 2026-02-17 v1

摘要

生成式检索已在推荐系统中作为一种有前途的范式,凭借对序列建模的优势超越传统双塔架构。然而,在大规模工业场景中,这类模型往往 suffer from 固有的即时性:由于单步推理和严格的延迟限制,它们倾向于将多样化用户意图坍缩为局部最优预测,无法捕捉长期和多物品消费模式。此外,现实检索系统必须遵循明确的检索指令,如类别级控制和策略约束。将此类指令遵循行为整合到生成式检索中仍具有挑战,因为现有的条件化或事后过滤方法往往妥协检索相关性或效率。在本工作中,我们提出 Climber-Pilot,这是一个统一的生成式检索框架以解决这两个限制。首先,我们引入时间感知的多物品预测(Time-Aware Multi-Item Prediction, TAMIP),这是一种旨在缓解生成式检索固有即时性的新训练范式。通过对时间感知的掩码将长期、多物品前瞻蒸馏到模型参数中,TAMIP 在保持高效单步推理的同时缓解了局部最优预测。其次,为支持灵活的指令遵循检索,我们提出条件感知稀疏注意力(Condition-Guided Sparse Attention, CGSA),通过稀疏注意力将业务约束直接整合到生成过程中,而无需额外的推理步骤。广泛的离线实验和在网易云音乐——全球最大的音乐流媒体平台之一——上的在线 A/B 测试表明,Climber-Pilot 显著优于最先进的基线,实现核心业务指标提升 4.24%。

关键词

引用

@article{arxiv.2602.13581,
  title  = {Climber-Pilot: A Non-Myopic Generative Recommendation Model Towards Better Instruction-Following},
  author = {Da Guo and Shijia Wang and Qiang Xiao and Yintao Ren and Weisheng Li and Songpei Xu and Ming Yue and Bin Huang and Guanlin Wu and Chuanjiang Luo},
  journal= {arXiv preprint arXiv:2602.13581},
  year   = {2026}
}