超越正确性和思维链:评估大语言模型的推理能力
人工智能
2026-02-13 v2
摘要
我们讨论了语言模型“推理”究竟意味着什么。当前的评估仅奖励模型的正确独立答案——但正确性alone无法揭示产生这些答案的过程。我们认为,推理不应被理解为静态的步骤链,而应被理解为思想在其中相互碰撞、演化为整合洞见的动态轨迹。基于辩证法传统,我们引入SIEV(Structured Inference Evaluation via Thesis-Antithesis-Synthesis),通过显式的thesis-antithesis-synthesis互动评估推理。SIEV产生可解释的轨迹,突出推理的关键属性:对挑战的鲁棒性、冲突下的可适应性、跨竞争观点的综合——这些是常规正确性基于的指标无法捕捉的维度。GSM和MMLU上的实证结果显示,最先进模型在SIEV的过程导向视角下存在显著推理能力差距:例如,GPT-5-chat在通过SIEV评估时,在GSM上得分下降超过40分(满分100分)。通过将注意力从模型给出的答案转向其到达答案的过程,SIEV使我们能够更透明、原则地区分结构化推理与表面模式生成,为评估和理解大语言模型的推理能力提供更清晰的基础。
引用
@article{arxiv.2510.18134,
title = {Evaluating LLM Reasoning Beyond Correctness and CoT},
author = {Soheil Abbasloo},
journal= {arXiv preprint arXiv:2510.18134},
year = {2026}
}