中文

超语言模型在分布外任务上的规模曲线:链条思维粒度的提升作用

计算与语言 2026-03-31 v2

摘要

对新型复合任务进行分布外泛化是部署基于变换器的语言模型 (LM) 的关键挑战。本文探讨了链式思维 (CoT) 作为增强 OOD 泛化的手段。通过对几类复合任务进行受控实验,我们揭示了三个关键发现:(1) 虽然在分布内准确率接近完美,但 QA 训练的模型在 OOD 性能会灾难性下降,即使有 10000k+ 训练样本;(2) CoT 数据的粒度与泛化性能密切相关,细粒度 CoT 数据导致更好的泛化;(3) CoT 具有惊人的样本效率,在更少(甚至 80%)的数据下即可匹配 QA 性能。理论上,我们表明复合任务本质上允许 Q-A 数据中的捷径,这与真实推理原则不吻合,而 CoT 强制模型内化有效的依赖结构,从而实现更好的泛化。进一步,我们展示了变换器位置编码可以放大泛化,通过强调长 CoT 序列中子任务条件的重复。我们的理论与实证分析为在真实世界分布偏移下实现 LM 对复合任务的泛化提供了令人信服的证据,表明 CoT 推理是实现 LM 泛化关键训练范式。

关键词

引用

@article{arxiv.2502.18273,
  title  = {Beyond In-Distribution Success: Scaling Curves of CoT Granularity for Language Model Generalization},
  author = {Ru Wang and Wei Huang and Selena Song and Haoyu Zhang and Qian Niu and Yusuke Iwasawa and Yutaka Matsuo and Jiaxian Guo},
  journal= {arXiv preprint arXiv:2502.18273},
  year   = {2026}
}

备注

Accepted at the Conference on Parsimony and Learning (CPAL) 2026