PICASSO:释放以GPU为中心的宽深推荐系统训练的潜力
分布式、并行与集群计算
2022-04-19 v2 信息检索
摘要
个性化推荐的发展显著提高了信息匹配的准确性以及电商平台的收入。近来呈现出两大趋势:1)推荐系统必须及时训练,以应对在线营销和社交网络中不断增长的新产品与不断变化的用户兴趣;2)SOTA推荐模型引入DNN模块以提高预测精度。传统的基于CPU的推荐系统无法满足这两大趋势,以GPU为中心的训练已成为一种流行方法。然而,我们观察到在训练推荐系统时GPU设备利用率不足,无法达到其在CV和NLP领域中所实现的预期吞吐量提升。该问题可由这些推荐模型的两个特征解释:首先,它们包含多达上千个输入特征域,引入了碎片化且内存密集的操作;其次,多个组成性的特征交互子模块引入了大量的小尺寸计算核。为消除推荐系统发展的这一障碍,我们提出了一种名为PICASSO的新框架,以在商用硬件上加速推荐模型的训练。具体而言,我们进行了系统分析以揭示训练推荐模型时遇到的瓶颈。我们利用模型结构和数据分布,通过打包、交错和缓存优化来释放硬件潜力。实验表明,PICASSO在SOTA基线的基础上将硬件利用率提高了一个数量级,并为多种工业推荐模型带来高达6倍的吞吐量提升。在生产中使用相同硬件预算的情况下,PICASSO平均将每日训练任务的挂钟时间缩短7小时,显著减少了持续交付的延迟。
引用
@article{arxiv.2204.04903,
title = {PICASSO: Unleashing the Potential of GPU-centric Training for Wide-and-deep Recommender Systems},
author = {Yuanxing Zhang and Langshi Chen and Siran Yang and Man Yuan and Huimin Yi and Jie Zhang and Jiamang Wang and Jianbo Dong and Yunlong Xu and Yue Song and Yong Li and Di Zhang and Wei Lin and Lin Qu and Bo Zheng},
journal= {arXiv preprint arXiv:2204.04903},
year = {2022}
}