中文

面向推荐系统中大词表类别特征的多粒度量化嵌入学习

信息检索 2020-08-26 v2

摘要

推荐系统模型通常通过嵌入来表示用户、物品和类别特征等各种稀疏特征。一种标准方法是将每个唯一特征值映射到一个嵌入向量。生成的嵌入表的大小随词表大小线性增长。因此,大词表不可避免地导致庞大的嵌入表,带来两个严重问题:(i) 在资源受限环境中使模型部署难以进行;(ii) 导致过拟合问题。在本文中,我们致力于为推荐系统(recsys)中的大词表稀疏特征学习高度紧凑的嵌入。首先,我们展示了新颖的可微乘积量化(Differentiable Product Quantization, DPQ)方法可推广到推荐系统问题。此外,为了更好地处理推荐系统中常见的幂律数据分布,我们提出了多粒度量化嵌入(Multi-Granular Quantized Embeddings, MGQE)技术,为低频物品学习更紧凑的嵌入。我们力求从新角度以紧凑模型规模提升推荐性能。在三个推荐任务和两个数据集上的大量实验表明,我们仅用约 20% 的原始模型规模即可达到相当或更好的性能。

关键词

引用

@article{arxiv.2002.08530,
  title  = {Learning Multi-granular Quantized Embeddings for Large-Vocab Categorical Features in Recommender Systems},
  author = {Wang-Cheng Kang and Derek Zhiyuan Cheng and Ting Chen and Xinyang Yi and Dong Lin and Lichan Hong and Ed H. Chi},
  journal= {arXiv preprint arXiv:2002.08530},
  year   = {2020}
}

备注

longer version