有效推理链降低内在维度
计算与语言
2026-02-11 v1 人工智能
机器学习
摘要
链式思维 (CoT) 推理及其变体在复杂推理任务中显著提升了语言模型的性能,但不同策略如何促进泛化的确切机制仍鲜有了解。虽然当前的解释常指向增加的测试时计算或结构引导,但建立这些因素与泛化之间的一致、可量化的联系仍具有挑战性。在本工作中,我们识别出内在维度作为刻画推理链有效性的定量度量。内在维度量化了在给定任务上达到给定准确阈值所需的模型维度最小数量。通过保持模型架构不变并通过不同的推理策略变化任务表述,我们展示,有效的推理策略一致地降低了任务的内在维度。在 GSM8K 上使用 Gemma-3 1B 和 4B 进行验证,我们观察到内在维度与其在分布内和分布外数据上的泛化性能之间存在强烈的反相关。我们的发现表明,有效的推理链通过更高效地使用更少的参数来压缩任务,从而促进学习,为分析推理过程提供了新的定量指标。
引用
@article{arxiv.2602.09276,
title = {Effective Reasoning Chains Reduce Intrinsic Dimensionality},
author = {Archiki Prasad and Mandar Joshi and Kenton Lee and Mohit Bansal and Peter Shaw},
journal= {arXiv preprint arXiv:2602.09276},
year = {2026}
}
备注
20 pages, 3 figures