中文

用于 CriteoTB 基准 MLPerf DLRM 模型的随机偏移块嵌入数组(ROBE):1000$\times$ 压缩与 3.1$\times$ 更快推理

信息检索 2022-01-25 v2 人工智能 机器学习

摘要

面向推荐数据的深度学习是近年来最普遍且最具挑战性的人工智能工作负载之一。最先进的推荐模型是与 GPT-3 和 Switch Transformer 相当的最大模型之一。深度学习的推荐模型(DLRM)的挑战源于为每个类别词元学习稠密嵌入。这些工业规模模型中的嵌入表可高达数百 TB。如此大的模型带来大量工程挑战,更不用说 prohibitive 的通信开销,以及更慢的训练与推理时间。其中,更慢的推理时间直接影响用户体验。DLRM 的模型压缩正获得关注,社区近期已展示令人印象深刻的压缩结果。本文中,我们提出随机偏移块嵌入数组(ROBE)作为嵌入表的低内存替代方案,其在保持精度并提升执行速度的同时,使内存使用降低数个数量级。ROBE 是改善缓存性能与随机哈希方差的一种简单基础性方法,其本身可能具有独立意义。我们证明,在使用少 1000×1000 \times 的内存的同时,可成功训练具有相同精度的 DLRM 模型。1000 倍压缩的模型直接带来更快的推理而无需任何工程投入。具体而言,我们展示可在单 GPU 上使用大小为 100MB 的 ROBE 数组训练 DLRM 模型,在官方 MLPerf CriteoTB 基准 DLRM 模型(100GB)所要求的 0.8025 或更高 AUC 下,实现约 3.1×3.1\times(209\%)的推理吞吐提升。

关键词

引用

@article{arxiv.2108.02191,
  title  = {Random Offset Block Embedding Array (ROBE) for CriteoTB Benchmark MLPerf DLRM Model : 1000$\times$ Compression and 3.1$\times$ Faster Inference},
  author = {Aditya Desai and Li Chou and Anshumali Shrivastava},
  journal= {arXiv preprint arXiv:2108.02191},
  year   = {2022}
}