中文

生成式推荐中自回归语义 ID 生成的表达能力限制

信息检索 2026-05-08 v1

摘要

生成式推荐 (GR) 模型通过自回归地生成一系列共同索引目标物品的离散 token 来生成物品。然而,这种自回归生成过程也引发了一个结构化解码空间,其对模型表达能力的影响仍有待探索。具体而言,逐 token 生成可被视为遍历由语义 ID token 导出的解码树,其中叶节点对应候选物品。我们观察到,GR 模型生成的物品概率与该树结构强相关:在树中相近的物品往往对任何给定用户都获得相似的概率,这使得难以基于用户特定偏好区分它们。我们进一步在理论上表明,这种结构相关性使得 GR 模型无法表示甚至传统协同过滤模型能很好捕捉的简单模式。为缓解此问题,我们提出了 Latte,一种在每个语义 ID 之前注入潜在 token 的简单修改,将解码空间从单棵树重塑为多棵潜在 token 条件树。此设计创建了具有不同树距离的多条路径,放松了树引发的概率耦合,在 NDCG@10 上平均实现了 3.45% 的相对提升。我们的代码可在 https://github.com/hyp1231/Latte 获取。

关键词

引用

@article{arxiv.2605.06331,
  title  = {Expressiveness Limits of Autoregressive Semantic ID Generation in Generative Recommendation},
  author = {Yupeng Hou and Haven Kim and Clark Mingxuan Ju and Eduardo Escoto and Neil Shah and Julian McAuley},
  journal= {arXiv preprint arXiv:2605.06331},
  year   = {2026}
}