中文

用于端侧推荐系统的稀疏训练

信息检索 2024-11-20 v1

摘要

推荐系统通常依赖于大型嵌入表,将用户和物品映射为统一大小的稠密向量,导致大量的内存消耗和低效。这在移动和物联网等内存受限的环境中尤为成问题,因为可扩展性和实时性能在这些环境中至关重要。各种研究工作一直试图解决这些问题。尽管利用动态稀疏训练(DST)的嵌入剪枝方法因其低训练和推理成本、一致的稀疏性以及端到端可微性而脱颖而出,但它们面临着关键挑战。首先,它们通常使用随机均匀稀疏初始化来初始化用于剪枝冗余参数的掩码矩阵。这种策略通常会导致次优性能,因为它会产生无结构且低效的连接。其次,当它们重新激活具有大梯度幅值的被剪枝参数时,往往偏袒在权重探索前单个批次中采样的用户/物品,这不一定能提高整体性能。第三,尽管它们在前向传播中使用稀疏权重,但在反向传播中仍需计算稠密梯度。在本文中,我们提出了 SparseRec,一种基于 DST 的轻量级嵌入方法来解决这些问题。具体而言,SparseRec 使用非负矩阵分解初始化掩码矩阵。它累积梯度以识别在激活后能更好提升模型性能的非活跃参数。此外,它通过对重要向量的子集进行采样,避免了反向传播中的稠密梯度。仅对该子集中的参数计算梯度,从而在训练的前向和反向传播中均保持稀疏性。

关键词

引用

@article{arxiv.2411.12205,
  title  = {Sparser Training for On-Device Recommendation Systems},
  author = {Yunke Qu and Liang Qu and Tong Chen and Xiangyu Zhao and Jianxin Li and Hongzhi Yin},
  journal= {arXiv preprint arXiv:2411.12205},
  year   = {2024}
}