原理化合成数据为 LLM 在推荐系统中首次发现 scaling laws
信息检索
2026-02-16 v2 人工智能
摘要
大语言模型 (LLM) 代表了推荐系统的一个有前景的前沿,但其开发受到不可预测的 scaling laws 缺失的制约,这些 scaling laws 对指导研究和优化资源分配至关重要。我们假设,这可能归因于先前持续预训练 (CPT) 工作中原始用户交互数据的固有噪声、偏差和不完整性。本文引入一种新型、分层的合成数据生成框架,以规避此类问题,为 LLM 创建一套精选、教育性的课程。我们提供强有力的直接证据,表明在我们的原理化合成数据上训练的标准序列模型在下游排序任务中显著优于(SasRec 的 recall@100 提升 130%)在真实数据上训练的模型,证明了其在学习可泛化用户偏好模式方面的优势。基于此,我们经验性地首次证明,对基于我们高质量、专为推荐领域设计的数据进行持续预训练的 LLM具有稳健的幂律 scaling。我们的实验揭示了跨多个合成数据模态的一致且可预测的困惑度降低。这一发现为在推荐领域可靠地放大 LLM 能力提供了基础方法,从而将研究焦点从缓解数据不足的限制转向利用高质量、结构化信息。
关键词
引用
@article{arxiv.2602.07298,
title = {Principled Synthetic Data Enables the First Scaling Laws for LLMs in Recommendation},
author = {Benyu Zhang and Qiang Zhang and Jianpeng Cheng and Hong-You Chen and Qifei Wang and Wei Sun and Shen Li and Jia Li and Jiahao Wu and Xiangjun Fan and Hong Yan},
journal= {arXiv preprint arXiv:2602.07298},
year = {2026}
}
备注
added more results on scaling law analysis