中文

下一词元预测的陷阱

计算与语言 2025-07-30 v3 人工智能 机器学习

摘要

仅仅一个下一词元预测器能否忠实地建模人类智能?我们明确了这一新兴关切,纠正了围绕它的普遍误解,并提倡一种简单的多词元目标。作为起点,我们认为下一词元预测中两个常被混为一谈的阶段——自回归推理与教师强制训练——必须被区别对待。那种认为误差会在自回归推理过程中累积的流行批评,关键性地假设了教师强制已经学习到了一个准确的下一词元预测器。这一假设回避了我们揭示的一个更深层的问题:在某些类别的任务中,教师强制根本无法学习到准确的下一词元预测器。我们描述了教师强制如何失效的一般机制,并设计了一个最小规划任务,在该任务中 Transformer 和 Mamba 架构均以这种方式在经验上失效——值得注意的是,尽管该任务本应很容易学习。最后,我们提供了初步证据,表明这种失效可以通过无教师训练来解决,这是一种使用虚拟词元提前预测多个词元的简单修改。我们希望这一发现能为未来的辩论奠定基础,并激发超越下一词元预测范式的探索。我们在 https://github.com/gregorbachmann/Next-Token-Failures 上公开了我们的代码。

关键词

引用

@article{arxiv.2403.06963,
  title  = {The pitfalls of next-token prediction},
  author = {Gregor Bachmann and Vaishnavh Nagarajan},
  journal= {arXiv preprint arXiv:2403.06963},
  year   = {2025}
}

备注

ICML 2024