中文

CAFE:面向大规模推荐模型的紧凑、自适应且快速的嵌入方法

机器学习 2024-03-28 v2

摘要

近年来,深度学习推荐模型(DLRM)中嵌入表不断增长的内存需求给模型训练和部署带来了巨大挑战。现有的嵌入压缩解决方案无法同时满足三个关键设计需求:内存效率、低延迟和对动态数据分布的适应性。本文提出了CAFE,一种紧凑、自适应且快速的嵌入压缩框架,以解决上述需求。CAFE的设计理念是动态地将更多内存资源分配给重要特征(称为热特征),并为不重要的特征分配较少的内存。在CAFE中,我们提出了一种快速且轻量级的草图数据结构,名为HotSketch,用于实时捕获特征重要性并报告热特征。对于每个报告的热特征,我们为其分配一个唯一的嵌入。对于非热特征,我们通过使用哈希嵌入技术允许多个特征共享一个嵌入。在我们的设计理念指导下,我们进一步提出了一个多级哈希嵌入框架来优化非热特征的嵌入表。我们从理论上分析了HotSketch的准确性,并分析了模型相对于偏差的收敛性。大量实验表明,CAFE显著优于现有的嵌入压缩方法,在Criteo Kaggle数据集和CriteoTB数据集上,以10000倍的压缩比,测试AUC分别提高了3.92%和3.68%。CAFE的源代码可在GitHub上获取。

关键词

引用

@article{arxiv.2312.03256,
  title  = {CAFE: Towards Compact, Adaptive, and Fast Embedding for Large-scale Recommendation Models},
  author = {Hailin Zhang and Zirui Liu and Boxuan Chen and Yikai Zhao and Tong Zhao and Tong Yang and Bin Cui},
  journal= {arXiv preprint arXiv:2312.03256},
  year   = {2024}
}