中文

Auto-Regressive Next Token Prediction 与 Full-Item-Vocabulary Maximum Likelihood Estimation 的等价性:面向生成式推荐的简短注记

信息检索 2026-04-20 v1

摘要

生成式推荐(GR)已成为工业级顺序推荐中广泛采用的范式。当前GR系统遵循类似的管线:用于项目索引的标记化、作为训练目标的下一个标记预测以及用于下一个项目生成的自回归解码。然而,现有GR研究主要聚焦于架构设计和经验性能优化,少有对自回归下一个标记预测在推荐场景下工作机制的严谨理论解释。本文形式化地证明了:\textbf{k-token自回归下一个标记预测(AR-NTP)范式在项目与其相应k标记序列之间存在双射映射的核心前提下,严格等价于全项目词汇最大似然估计(FV-MLE)}。我们进一步表明,这一等价性适用于级联标记化和并行标记化两种最广泛使用的工业GR系统方案。我们的结果为占主导地位的工业GR范式提供了首个正式的理论基础,并为未来GR系统优化提供原则性指导。

关键词

引用

@article{arxiv.2604.15739,
  title  = {On the Equivalence Between Auto-Regressive Next Token Prediction and Full-Item-Vocabulary Maximum Likelihood Estimation in Generative Recommendation--A Short Note},
  author = {Yusheng Huang and Shuang Yang and Zhaojie Liu and Han Li},
  journal= {arXiv preprint arXiv:2604.15739},
  year   = {2026}
}

备注

Work in progress