TokenMixer-Large:面向工业级推荐系统的大规模排序模型扩展
信息检索
2026-02-11 v2
摘要
尽管推荐模型的扩展规律正在获得显著关注,但现有架构如 Wukong、HiFormer 和 DHEN 常常在设计次优和硬件资源利用不足方面存在挑战,限制了其实际可扩展性。我们之前的 TokenMixer 架构(在 RankMixer 论文中提出)通过用轻量级 token 混合算子取代自注意力机制,解决了效果和效率问题;然而在更深层配置中仍面临关键瓶颈,包括次优的残差路径、梯度消失、MoE 稀疏化不完整以及受限的可扩展性。在本文中,我们提出 TokenMixer-Large,一个为极端规模推荐系统系统化演化的架构。通过引入混合-恢复操作、跨层残差连接和辅助损失,我们确保即使模型深度增加也能实现稳定的梯度传播。此外,我们引入稀疏 per-token MoE 以实现高效的参数扩展。TokenMixer-Large 成功将参数规模扩展至70亿和150亿(分别在在线流量和离线实验中),目前已在字节跳动多个场景中部署,实现了显著的离线和在线性能提升,电商订单提升 +1.66%,人均预览支付 GMV 提升 +2.98%,广告投放效果提升 +2.0%,直播间收入增长 +1.4%。
引用
@article{arxiv.2602.06563,
title = {TokenMixer-Large: Scaling Up Large Ranking Models in Industrial Recommenders},
author = {Yuchen Jiang and Jie Zhu and Xintian Han and Hui Lu and Kunmin Bai and Mingyu Yang and Shikang Wu and Ruihao Zhang and Wenlin Zhao and Shipeng Bai and Sijin Zhou and Huizhi Yang and Tianyi Liu and Wenda Liu and Ziyan Gong and Haoran Ding and Zheng Chai and Deping Xie and Zhe Chen and Yuchao Zheng and Peng Xu},
journal= {arXiv preprint arXiv:2602.06563},
year = {2026}
}