中文

当小模型因错误原因而正确:可信智能体的过程验证

机器学习 2026-01-05 v1

摘要

部署参数为7-9B的小型语言模型作为自主智能体,需要信任其推理过程而非仅其输出。我们揭示了一个关键可靠性危机:50-69%的正确答案包含根本性的推理缺陷——一种标准准确度指标无法察觉的“错误原因正确”现象。通过分析跨三款模型和多样化任务的10,734条推理轨迹,我们引入了推理完整性得分(RIS),该基于过程的指标经与大量评审者间一致性检验(κ=0.657\kappa=0.657)验证。我们的发现挑战了常规实践:检索增强生成(RAG)显著提升推理完整性(Cohen's d=0.23d=0.23--0.930.93),但元认知干预如自我批判在小模型上常常损害性能(d=0.14d=-0.140.33-0.33)。机械分析表明,RAG通过在外部证据上校准计算,使错误率降低7.6%,而元认知则在模型容量不足时放大混淆。为实现部署,我们将验证能力蒸馏为一个神经分类器,实现0.86的F1分数且速度提升100倍。这些结果凸显了面向可信智能体的过程化验证的必要性:仅凭准确性在模型可完全错误原因正确的情况下便显得危险且不足。

关键词

引用

@article{arxiv.2601.00513,
  title  = {When Small Models Are Right for Wrong Reasons: Process Verification for Trustworthy Agents},
  author = {Laksh Advani},
  journal= {arXiv preprint arXiv:2601.00513},
  year   = {2026}
}

备注

Accepted to Trustagent workshop AAAI 2026