思维的形状:推理任务中分布比正确性更重要
人工智能
2026-01-26 v2 机器学习
摘要
我们提出了一个令人惊讶的发现:通过训练来自更强大模型的链律(CoT)痕迹的合成数据集,即使这些痕迹导致最终答案错误,仍可提升语言模型的推理能力。我们的实验表明,这种方法在推理任务上优于训练于人类标注数据集。我们假设解释这一现象的两个关键因素:首先,合成数据的分布本质上更接近语言模型自身的分布,使其更易于学习。其次,这些“错误”痕迹往往只是部分有缺陷,包含可供模型学习的有效推理步骤。为进一步检验第一个假设,我们使用语言模型对人类标注痕迹进行改写——将其分布移近模型自身的分布——并显示这会提高性能。对于第二个假设,我们引入越来越不完整的 CoT 痕迹并研究模型对这些缺陷的容忍程度。我们在各种推理领域(如数学、算法推理和代码生成)使用 MATH、GSM8K、Countdown 和 MBPP 数据集,并针对各种语言模型(规模从 1.5B 到 9B,涵盖 Qwen、Llama 和 Gemma 模型)展示了我们的发现。我们的研究表明,使数据集更接近模型分布是需要考虑的关键方面。我们还展示了正确的最终答案并不一定是忠实推理过程的可靠指示器。
引用
@article{arxiv.2512.22255,
title = {Shape of Thought: When Distribution Matters More than Correctness in Reasoning Tasks},
author = {Abhranil Chandra and Ayush Agrawal and Arian Hosseini and Sebastian Fischmeister and Rishabh Agarwal and Navin Goyal and Aaron Courville},
journal= {arXiv preprint arXiv:2512.22255},
year = {2026}
}