面向顺序 transducer 生成式推荐的海量记忆与百万级参数
信息检索
2026-03-27 v3 机器学习
摘要
现代大规模推荐系统高度依赖用户交互历史序列来提升模型性能。近期大型语言模型和序列建模技术的出现,尤其是类 Transformer 架构,带来了显著进展(如 HSTU、SIM 和 TWIN 模型)。尽管对超长用户历史(10k 至 100k 项目)进行扩展通常会改善模型性能,但也在行业级推荐系统中造成了显著的延迟、查询每秒 (QPS) 和 GPU 成本挑战。现有模型未能充分解决这些工业级可扩展性问题。本文提出了一种新型两阶段建模框架,即 VIrtual Sequential Target Attention (VISTA),该框架将传统的目标注意力从候选项目分解为两个 distinct 阶段:(1) 将用户历史汇总为少数几百个标记;随后 (2) 对候选项目注意力聚焦于这些标记。这些汇总标记嵌入随后被缓存到存储系统中,用于下游模型训练和推断。这种 novel 设计使 VISTA 能够扩展到终身级用户历史(最高可达一百万个项目),同时保持下游训练和推断成本不变,这在工业界至关重要。我们的方法在离线和在线指标上均实现了显著提升,并已成功部署在面向数十亿用户的工业领先推荐平台上。
关键词
引用
@article{arxiv.2510.22049,
title = {Massive Memorization with Hundreds of Trillions of Parameters for Sequential Transducer Generative Recommenders},
author = {Zhimin Chen and Chenyu Zhao and Ka Chun Mo and Yunjiang Jiang and Jane H. Lee and Khushhall Chandra Mahajan and Ning Jiang and Kai Ren and Jinhui Li and Wen-Yun Yang},
journal= {arXiv preprint arXiv:2510.22049},
year = {2026}
}
备注
ICLR 2026