中文

Wukong:迈向大规模推荐的缩放定律

机器学习 2024-06-05 v4 人工智能

摘要

缩放定律在模型质量的可持续提升中发挥着关键作用。不幸的是,由于扩展机制的低效性,迄今为止的推荐模型并未表现出类似于大语言模型领域所观察到的此类定律。这一局限性给这些模型适应日益复杂的现实世界数据集带来了重大挑战。在本文中,我们提出了一种完全基于堆叠分解机 (factorization machines) 的有效网络架构,以及一种协同扩展策略,统称为 Wukong,旨在建立推荐领域的缩放定律。Wukong 的独特设计使其能够仅通过更深和更宽的层来捕捉多样化的任意阶交互。我们在六个公共数据集上进行了广泛评估,结果表明 Wukong 在质量上始终优于最先进模型。此外,我们在一个内部大规模数据集上评估了 Wukong 的可扩展性。结果显示,Wukong 在质量上保持了对最先进模型的优势,同时在模型复杂度跨越两个数量级(扩展至超过 100 GFLOP/样本,而先前研究在此处表现不足)的情况下仍保持缩放定律。

关键词

引用

@article{arxiv.2403.02545,
  title  = {Wukong: Towards a Scaling Law for Large-Scale Recommendation},
  author = {Buyun Zhang and Liang Luo and Yuxin Chen and Jade Nie and Xi Liu and Daifeng Guo and Yanli Zhao and Shen Li and Yuchen Hao and Yantao Yao and Guna Lakshminarayanan and Ellie Dingqiao Wen and Jongsoo Park and Maxim Naumov and Wenlin Chen},
  journal= {arXiv preprint arXiv:2403.02545},
  year   = {2024}
}

备注

12 pages