中文

一种具有可预测尺度规律和可证明推理优势的层次化语言模型

机器学习 2026-05-14 v1 人工智能 机器学习

摘要

我们引入一族具有层次结构的合成语言——通过树上的广播过程生成——以便精确分析自回归生成中上下文长度和推理的作用。我们方法的核心是一种精确的k-gram假设,用以取代上下长度为k的transformer。我们随后在此假设上进行经验验证。利用此假设,我们推导了训练模型所产生序列的分布统计的显式渐近预测,具体包括两种情形。对于Ising广播过程(一种软约束语言),我们证明生成总和的方差随上下文深度呈对数线性增长,其峰度收敛于高斯分布的峰度——两者均偏离真实语言。对于着色广播过程(一种硬约束语言)在冻结 régime 下,受限上下文自回归生成的序列几乎不可能与底层树的任何有效着色相符。由此,我们得出上下文长度至少为Ω(n)\Omega(n) 的下界才能忠实抽样长度为n的序列。相比之下,我们证明,仅需Θ(logn)\Theta(\log n) 的工作存储量即可进行自回归推理模型,从而从真实语言中进行精确抽样——实现指数级的改进。我们通过在合成语言上训练的transformer经验上确认了下界预测和推理方法的上界,训练得到的模型在广泛的上下文大小范围内都量化地跟随我们的渐近预测。

关键词

引用

@article{arxiv.2605.13687,
  title  = {A Hierarchical Language Model with Predictable Scaling Laws and Provable Benefits of Reasoning},
  author = {Jason Gaitonde and Frederic Koehler and Elchanan Mossel and Joonhyung Shin and Allan Sly},
  journal= {arXiv preprint arXiv:2605.13687},
  year   = {2026}
}