中文

语义 ID 与哈希 ID 融合:顺序推荐系统的最佳实践

信息检索 2026-05-29 v2 人工智能

摘要

传统顺序推荐系统(Sequential Recommender Systems,简称 SRS)通常为每个项目分配唯一的哈希 ID(HID),以构建项目嵌入,这些嵌入主要捕获来自历史用户-项目交互的协同信号。然而,这些嵌入在长尾场景中容易出问题,因为大多数项目很少被消费。最近采用辅助信息的方法常常面临来自共现信号的协同共享噪声或由平坦稠密嵌入引起的语义同质性。相比之下,带有代码共享和多粒度语义建模支持的语义 ID(SID)提供了有前景的替代方案。然而,SID 基于的方法受到协同压倒现象的制约:常采用的量化机制会损害建模头部项目所需的标识符唯一性,导致头部和尾部项目性能之间出现权衡。为解决这一挑战,我们提出了 H2Rec,一种融合 SID 和 HID 的新型框架。我们设计了双分支建模架构,同时捕获 SID 的多粒度语义,同时保留 HID 提供的独特协同身份标识。此外,我们引入双层对齐策略以桥接两种表示,实现有效的知识传递和稳健的偏好建模。大量离线实验在三个公开基准数据集上以及大规模商业平台上的在线实验表明,H2Rec 在头部和尾部推荐质量之间实现了更好的平衡,并持续优于现有基线方法。

关键词

引用

@article{arxiv.2512.10388,
  title  = {The Best of the Two Worlds: Harmonizing Semantic and Hash IDs for Sequential Recommendation},
  author = {Ziwei Liu and Yejing Wang and Wanyu Wang and Wang Zejian and Qidong Liu and Zijian Zhang and Chong Chen and Wei Huang and Xiangyu Zhao},
  journal= {arXiv preprint arXiv:2512.10388},
  year   = {2026}
}