中文

下一词预测的可证明长程优势

机器学习 2025-12-09 v1 人工智能 机器学习

摘要

为何现代语言模型在训练目标为下一词预测时,能够生成连贯的文档并捕捉长程结构?本文表明,下一词预测在学习更长程结构方面是可证明强大的,即使采用常见的神经网络架构。具体而言,我们证明,对循环神经网络(RNN)进行下一词预测优化,可得到的模型与训练分布高度吻合:对于从训练分布中抽取的待评估文档,任何受描述长度有界限制且仅检查下一个 kk 个词的算法,都无法区分这些文档中连续 kk 个词与遵循相同前缀的所学语言模型生成的 kk 个词。我们给出了相对于 kk(独立于文档长度)的多项式界限,说明实现此 kk 词不可区分性所需的模型规模,为实践中观察到的长程连贯性提供了复杂度论解释。

关键词

引用

@article{arxiv.2512.07818,
  title  = {Provable Long-Range Benefits of Next-Token Prediction},
  author = {Xinyuan Cao and Santosh S. Vempala},
  journal= {arXiv preprint arXiv:2512.07818},
  year   = {2025}
}

备注

66 pages, 5 figures