RelayGR:通过跨阶段 relay-race 推理扩展长序列生成式推荐
分布式、并行与集群计算
2026-01-06 v1 人工智能
机器学习
摘要
实时推荐系统在严格的尾部延迟 SLO 约束下执行多阶段级联(检索、预处理、精细排序),仅剩下几毫秒用于排序。生成式推荐(GR)模型可以通过消耗长用户行为序列来提高质量,但在实际生产中,其在线序列长度受排序阶段 P99 预算严格限制。我们观察到大多数 GR token 编码的行为与物品候选无关,这表明可以在排序之前一次性预推理用户行为前缀并在排序时重用,而无需在关键路径上重新计算。我们实现了 RelayGR,一种生产级系统,使其支持 in-HBM relay-race 推理。RelayGR选择性地预推理长期用户前缀,将其 KV 缓存保留在 HBM 中跨请求生命周期,并确保后续排序能够在无远程获取的情况下消费它们。RelayGR 结合了三种技术:1) 序列感知触发器,在受限缓存占用和预推理负载下仅放行高风险请求,2) 亲和性感知路由器通过将辅助预推理信号和排序请求都路由到同一实例来实现缓存生产和消费的共置,3) 内存感知扩张器使用服务器本地 DRAM 捕获短期跨请求复用,同时避免冗余重新加载。我们在华为 Ascend NPU 上实现 RelayGR 并使用真实查询进行评估。在固定 P99 SLO 下,RelayGR 支持最高 1.5 倍的序列长度,并在 SLO 合规吞吐量上提升最高 3.6 倍。
引用
@article{arxiv.2601.01712,
title = {RelayGR: Scaling Long-Sequence Generative Recommendation via Cross-Stage Relay-Race Inference},
author = {Jiarui Wang and Huichao Chai and Yuanhang Zhang and Zongjin Zhou and Wei Guo and Xingkun Yang and Qiang Tang and Bo Pan and Jiawei Zhu and Ke Cheng and Yuting Yan and Shulan Wang and Yingjie Zhu and Zhengfan Yuan and Jiaqi Huang and Yuhan Zhang and Xiaosong Sun and Zhinan Zhang and Hong Zhu and Yongsheng Zhang and Tiantian Dong and Zhong Xiao and Deliang Liu and Chengzhou Lu and Yuan Sun and Zhiyuan Chen and Xinming Han and Zaizhu Liu and Yaoyuan Wang and Ziyang Zhang and Yong Liu and Jinxin Xu and Yajing Sun and Zhoujun Yu and Wenting Zhou and Qidong Zhang and Zhengyong Zhang and Zhonghai Gu and Yibo Jin and Yongxiang Feng and Pengfei Zuo},
journal= {arXiv preprint arXiv:2601.01712},
year = {2026}
}