利用 Semantic ID 增强推荐系统中嵌入表示的稳定性
信息检索
2025-04-04 v1 人工智能
摘要
在线内容的指数级增长给工业推荐系统中基于 ID 的模型带来了重大挑战,包括极高的基数和动态增长的 ID 空间、高度倾斜的参与度分布,以及由于自然 ID 生命周期(例如新 ID 的诞生和旧 ID 的退役)导致的预测不稳定性。为了解决这些问题,许多系统依赖随机哈希来处理 ID 空间并控制相应的模型参数(即嵌入表)。然而,这种方法引入了由多个 ID 共享同一嵌入导致的数据污染,从而导致模型性能下降和嵌入表示不稳定。本文研究了这些挑战,并引入了 Semantic ID prefix ngram,这是一种新颖的 token 参数化技术,可显著提升原始 Semantic ID 的性能。Semantic ID prefix ngram 通过基于内容嵌入对物品进行分层聚类来创建有意义的语义碰撞,而非随机分配。通过广泛的实验,我们证明 Semantic ID prefix ngram 不仅解决了嵌入不稳定性问题,还显著改善了长尾 ID 建模,减少了过拟合,并缓解了表示偏移。我们进一步强调了 Semantic ID prefix ngram 在对用户历史进行上下文化处理的注意力模型中的优势,展示了显著的性能提升。我们还报告了将 Semantic ID 集成到 Meta 生产 Ads Ranking 系统中的经验,在真实部署中带来了显著的性能提升和增强的预测稳定性。
引用
@article{arxiv.2504.02137,
title = {Enhancing Embedding Representation Stability in Recommendation Systems with Semantic ID},
author = {Carolina Zheng and Minhui Huang and Dmitrii Pedchenko and Kaushik Rangadurai and Siyu Wang and Gaby Nahum and Jie Lei and Yang Yang and Tao Liu and Zutian Luo and Xiaohan Wei and Dinesh Ramasamy and Jiyan Yang and Yiping Han and Lin Yang and Hangjun Xu and Rong Jin and Shuang Yang},
journal= {arXiv preprint arXiv:2504.02137},
year = {2025}
}