中文

DQRM:深度量化推荐模型

信息检索 2024-10-29 v1 人工智能

摘要

大规模推荐模型目前是许多大型互联网公司的主要工作负载。这些推荐器的特征是拥有庞大的嵌入表,这些表被用户和物品特征的索引稀疏访问。这些大小超过 1TB 的表给推荐模型的训练和推理带来了严重的内存瓶颈。在本工作中,基于最先进的深度学习推荐模型(DLRM),我们提出了一种新颖的推荐框架,该框架体积小、功能强大且运行和训练高效。所提出的框架使云服务器上的推理更加高效,探索了在较小的边缘设备上部署强大推荐器的可能性,并优化了数据并行设置下分布式训练中通信开销的工作负载。具体而言,我们表明量化感知训练(QAT)可以施加强大的正则化效应,以缓解 DLRM 遭受的严重过拟合问题。因此,我们在没有任何精度下降的情况下实现了 DLRM 模型的 INT4 量化。我们进一步提出了两种技术,专门针对推荐模型中的嵌入表改进并加速常规的 QAT 工作负载。此外,为了实现高效训练,在得到良好支持的指定稀疏化的基础上,我们将嵌入表的梯度量化为 INT8。我们表明,将梯度稀疏化和量化结合在一起显著减少了通信量。简而言之,采用 INT4 的 DQRM 模型在 Kaggle 上以 0.27 GB 的模型大小实现了 79.07% 的准确率,在 Terabyte 数据集上以 1.57 GB 的模型大小实现了 81.21% 的准确率,这甚至超过了模型尺寸大得多的 FP32 DLRM(在 Kaggle 上为 2.16 GB,在 Terabyte 上为 12.58 GB)。

关键词

引用

@article{arxiv.2410.20046,
  title  = {DQRM: Deep Quantized Recommendation Models},
  author = {Yang Zhou and Zhen Dong and Ellick Chan and Dhiraj Kalamkar and Diana Marculescu and Kurt Keutzer},
  journal= {arXiv preprint arXiv:2410.20046},
  year   = {2024}
}