中文

推理扩缩是否提升推理忠诚度?基于自洽性权衡的多模型分析

人工智能 2026-01-13 v1

摘要

自洽性( Self-consistency) 作为提升大语言模型在推理任务上准确率的流行技术。该方法简单有效:生成多个推理路径,通过多数投票选择最常见的答案。虽然能可靠提升准确率,但是否反映推理质量的真实提升仍不明了。我们探讨一个尚未研究的根本问题:推理扩缩是否提升推理忠诚度?我们在100个GSM8K数学推理问题上,对四个前沿模型(GPT-5.2、Claude Opus 4.5、Gemini-3-flash-preview 和 DeepSeek-v3.2)进行全面实证研究。我们的分析采用 bootstrap 置信区间、McNemar 成对比较检验和 Cohen's d效应大小对效应进行严格量化。结果显示不同模型间存在显著差异,挑战了关于自洽性的常见假设。GPT-5.2呈现预期模式:准确率在 N=5 时提升至90%,而忠诚度保持相对稳定(0.540 到 0.510)。Claude Opus 4.5 故事完全不同:准确率反而从78%下降至74.3%,但忠诚度在 N=5 时 dramatic地从0.270提高至0.891。DeepSeek-v3.2 已达98%准确率,显示出 ceiling 效应,忠诚度仅有温和提升(0.440 到 0.541)。Gemini-3-flash 从81%提升至86%准确率,忠诚度略有下降(0.260 到 0.212)。问题难度分析显示GPT-5.2解答82%的难题,却仅破解13%的简单题。相比之下,Claude破解了23%的简单题,这解释了其准确率下降。这些发现对实践者意义重大:自洽性并非在所有情况下都有益,团队应在实际部署前测试具体模型。我们发布代码并提供实用建议以导航这些权衡。

关键词

引用

@article{arxiv.2601.06423,
  title  = {Does Inference Scaling Improve Reasoning Faithfulness? A Multi-Model Analysis of Self-Consistency Tradeoffs},
  author = {Deep Mehta},
  journal= {arXiv preprint arXiv:2601.06423},
  year   = {2026}
}

备注

24 pages, 3 figures, 9 tables