中文

面向推荐的目录原生 LLM:通过 Item-ID 口语方言降低 entanglement

计算与语言 2026-04-14 v2 机器学习

摘要

虽然协同过滤在预测精度和效率方面表现出色,大语言模型(LLM)则在表达性和可泛化推理方面发挥着关键作用,但现代推荐系统必须将这两者结合起来。不断增长的用户期望(如自然语言查询和透明解释)进一步凸显了需要统一方法的需求。然而,这并非易事。协同信号往往在 token 效率上表现出色,但在语义上含糊不清;而 LLM 则在语义丰富度上占据优势,但在仅基于文本输入训练时,难以建模隐式用户偏好。本文引入了 Item-ID + Oral-language Mixture-of-Experts Language Model(IDIOMoE),将项目交互历史视为语言空间中的一种本土方言,使协同信号能够以与自然语言相同的方式被理解。通过将每个预训练 LLM 块的前馈网络分为独立的文本专家和项目专家,并采用 token-type gating,我们的方法避免了文本和目录模态之间的破坏性干扰。IDIOMoE 在公共和专有数据集上均表现出强大的推荐性能,同时保持了预训练模型的文本理解能力。

关键词

引用

@article{arxiv.2510.05125,
  title  = {Catalog-Native LLM: Speaking Item-ID Dialect with Less Entanglement for Recommendation},
  author = {Reza Shirkavand and Xiaokai Wei and Chen Wang and Zheng Hui and Heng Huang and Michelle Gong},
  journal= {arXiv preprint arXiv:2510.05125},
  year   = {2026}
}