中文

SHARK:一种面向大规模推荐系统的轻量模型压缩方法

信息检索 2023-08-21 v1

摘要

增大嵌入层规模已被证明能有效提升推荐模型性能,但也逐渐导致工业推荐系统中模型规模超过 TB 级,进而增加计算与存储成本。为在节省资源的同时保持模型性能,我们提出 SHARK——我们在工业场景推荐系统中总结出的模型压缩实践。SHARK 包含两个主要组件。首先,我们使用泰勒展开的一阶项作为重要性分数,以剪枝嵌入表(特征域)的数量。其次,我们引入一种新的按行量化方法,对每个嵌入应用不同的量化策略。我们在公开与工业数据集上进行了广泛实验,表明所提 SHARK 框架的各组件均优于以往方法。我们在快手的多个模型(如短视频、电商与广告推荐模型)上进行了 A/B 测试。在线 A/B 测试结果表明,SHARK 能有效缩减嵌入层的内存占用。在短视频场景中,无任何性能损失的压缩模型显著节省 70% 存储与数千台机器,提升 30% 每秒查询率(QPS),并已部署服务于数亿用户、每日处理数百亿次请求。

关键词

引用

@article{arxiv.2308.09395,
  title  = {SHARK: A Lightweight Model Compression Approach for Large-scale Recommender Systems},
  author = {Beichuan Zhang and Chenggen Sun and Jianchao Tan and Xinjun Cai and Jun Zhao and Mengqi Miao and Kang Yin and Chengru Song and Na Mou and Yang Song},
  journal= {arXiv preprint arXiv:2308.09395},
  year   = {2023}
}

备注

accepted by cikm 2023