中文

何时浅层网络胜出:隐式推理中的深度精度悖论与静默失效

机器学习 2026-03-05 v1 人工智能 计算与语言

摘要

数学推理模型广泛应用于教育、自动 tutoring 和决策支持系统,尽管其 exhibits fundamental computational instabilities。我们展示了最先进模型 (Qwen2.5-Math-7B) 通过可靠且不可靠推理路径的混合方式实现 61% 的准确率:18.4% 的正确预测采用稳定、忠实的推理路径,而 81.6% 的正确预测则通过计算不一致的路径实现。此外,8.8% 的所有预测为静默失效——即自信却错误的输出。通过使用新颖的忠实度指标进行全面分析,我们揭示:(1) 推理质量与正确性之间呈现弱负相关 (r=-0.21, p=0.002),反映了二元分类阈值 artifacts 而非呈单调反关系;(2) 从 1.5B 参数放大到 7B 参数 (4.7 倍增加) 在我们评估的子集上 (GSM8K 的 6%) 提供零准确率提益,需在完整基准上进行验证;(3) 隐式推理采用多样化的计算策略,其中约 20% 共享 CoT-like 模式。这些发现表明,基准准确率可能掩盖计算不可靠性,要求超越单样本指标的稳定性测评进行评估改革。

关键词

引用

@article{arxiv.2603.03475,
  title  = {When Shallow Wins: Silent Failures and the Depth-Accuracy Paradox in Latent Reasoning},
  author = {Subramanyam Sahoo and Aman Chadha and Vinija Jain and Divya Chaudhary},
  journal= {arXiv preprint arXiv:2603.03475},
  year   = {2026}
}

备注

Accepted at ICLR 2026 Workshop on Latent & Implicit Thinking - Going Beyond CoT Reasoning. 19 Pages and 5 Figures