Kunlun:通过统一架构设计建立大规模推荐系统的扩展定律
信息检索
2026-02-17 v2 人工智能
摘要
确定支配模型性能与计算投入关系的可预测扩展规律,对设计和分配大规模推荐系统的资源至关重要。虽然大型语言模型已建立此类规律,但针对同时处理用户历史和上下文特征的推荐系统仍面临挑战。我们识别出规模效率不足是可预测幂律扩展的主要障碍,源于模型FLOPs利用率(MFU)低的低效模块和次优资源分配。我们引入Kunlun,一种系统性提高模型效率和资源分配的可扩展架构。我们的低层优化包括广义点积注意力(GDPA)、层次种子池化(HSP)和滑动窗口注意力。我们的高层创新包括计算跳过(CompSkip)和事件级个性化。这些进展使NVIDIA B200 GPU上的MFU从17%提升至37%,相较于最先进方法实现扩展效率翻倍。Kunlun现已部署于Meta Ads的主要模型中,显著产生实际效果。
引用
@article{arxiv.2602.10016,
title = {Kunlun: Establishing Scaling Laws for Massive-Scale Recommendation Systems through Unified Architecture Design},
author = {Bojian Hou and Xiaolong Liu and Xiaoyi Liu and Jiaqi Xu and Yasmine Badr and Mengyue Hang and Sudhanshu Chanpuriya and Junqing Zhou and Yuhang Yang and Han Xu and Qiuling Suo and Laming Chen and Yuxi Hu and Jiasheng Zhang and Huaqing Xiong and Yuzhen Huang and Chao Chen and Yue Dong and Yi Yang and Shuo Chang and Xiaorui Gan and Wenlin Chen and Santanu Kolay and Darren Liu and Jade Nie and Chunzhi Yang and Ellie Wen and Jiyan Yang and Huayu Li},
journal= {arXiv preprint arXiv:2602.10016},
year = {2026}
}
备注
10 pages, 4 figures