BOLT:一种在商用 CPU 硬件上训练与部署大规模搜索与推荐模型的自动化深度学习框架
机器学习
2023-09-13 v4
摘要
在商用 CPU 硬件上高效地进行大规模神经网络训练与推理,对于深度学习(DL)能力的普及具有重大的实际意义。目前,训练由数亿至数十亿参数组成的巨型模型,需要大量使用 GPU 等专用硬件加速器,而这些设备仅有少数财力雄厚的机构能够负担。此外,训练和部署这些模型往往伴随着惊人的碳足迹。在本文中,我们朝着应对这些挑战迈出了一步,提出了 BOLT——一个用于在标准 CPU 硬件上训练大规模搜索与推荐模型的稀疏深度学习库。BOLT 提供了灵活的高级 API 来构建模型,对现有流行 DL 框架的用户而言十分熟悉。通过自动调优专用超参数,BOLT 还屏蔽了稀疏网络训练的算法细节。我们在多项信息检索任务上评估了 BOLT,包括商品推荐、文本分类、图神经网络以及个性化。我们发现,所提出的系统以极低的成本和能耗达到了与最先进技术(SOTA)相竞争的性能,且推理速度快一个数量级。BOLT 也已由多家企业成功部署以解决关键问题,我们重点介绍了一个电子商务领域的客户案例。
引用
@article{arxiv.2303.17727,
title = {BOLT: An Automated Deep Learning Framework for Training and Deploying Large-Scale Search and Recommendation Models on Commodity CPU Hardware},
author = {Nicholas Meisburger and Vihan Lakshman and Benito Geordie and Joshua Engels and David Torres Ramos and Pratik Pranav and Benjamin Coleman and Benjamin Meisburger and Shubh Gupta and Yashwanth Adunukota and Tharun Medini and Anshumali Shrivastava},
journal= {arXiv preprint arXiv:2303.17727},
year = {2023}
}
备注
6 pages, 5 tables, 3 figures. CIKM 2023 (Applied Research Track)