低精度硬件架构与大规模推荐模型推理的相遇
机器学习
2021-05-27 v1 硬件体系结构
信息检索
数值分析
性能
数值分析
摘要
机器学习(ML)的巨大成功以及 ML 模型复杂度的持续增长,促使 CPU 与加速器架构中出现了许多 ML 专用的设计以加速模型推理。尽管这些架构多种多样,高度优化的低精度算术却是大多数架构共有的组成部分。这些架构在基准 ML 模型上确实常展现出令人印象深刻的算力吞吐。然而,对 Facebook 个性化服务至关重要的生产模型(如推荐系统)需求严苛且复杂:这些系统必须每月响应式地以低延迟服务数十亿用户,同时保持高预测精度,尽管每次推理涉及数百亿参数的计算。这些低精度架构能与我们的生产推荐系统良好配合吗?能。但并非无需大量努力。我们在本文中分享了使参考推荐模型适配低精度硬件的搜索策略、低精度计算核的优化,以及工具链的与设计开发,从而在这些模型生命周期内(其间话题趋势与用户兴趣不可避免地演化)维持其精度。践行这些低精度技术帮助我们节省了数据中心容量,同时部署了复杂度高达 5 倍的模型,否则这些模型无法在传统通用 CPU 上部署。我们相信这些来自一线的经验能促进硬件架构与软件工程之间更好的协同设计,并推进工业界 ML 的技术水平。
引用
@article{arxiv.2105.12676,
title = {Low-Precision Hardware Architectures Meet Recommendation Model Inference at Scale},
author = {Zhaoxia and Deng and Jongsoo Park and Ping Tak Peter Tang and Haixin Liu and Jie and Yang and Hector Yuen and Jianyu Huang and Daya Khudia and Xiaohan Wei and Ellie Wen and Dhruv Choudhary and Raghuraman Krishnamoorthi and Carole-Jean Wu and Satish Nadathur and Changkyu Kim and Maxim Naumov and Sam Naghshineh and Mikhail Smelyanskiy},
journal= {arXiv preprint arXiv:2105.12676},
year = {2021}
}