中文

当链条中断:大语言模型链式思考推理错误的交互诊断

人机交互 2026-04-07 v2

摘要

当前的大型语言模型(LLM),尤其是大型推理模型,可生成链式思考(CoT)推理轨迹,以说明其如何生成最终输出,从而促进用户对信任的校准。然而,这些 CoT 推理轨迹通常冗长且繁琐,可能包含各种问题,如逻辑和事实错误,这使得用户难以高效且准确地解释推理轨迹。为此,我们开发了一个结合外部事实核查和符号形式逻辑验证的错误检测管道,用于在步骤级别识别错误。基于此管道,我们提出了 ReasonDiag,一个用于诊断 CoT 推理轨迹的交互式可视化系统。ReasonDiag 提供1)用于显示推理步骤分布和错误传播模式的集成弧形图,以及2)用于可视化高层次推理流程和前提依赖关系的分层节点链接图。我们通过技术评估错误检测管道、两个案例研究以及对16名用户的访谈来评估 ReasonDiag。结果表明,ReasonDiag 有助于用户有效理解 CoT 推理轨迹、识别错误步骤并确定其根本原因。

关键词

引用

@article{arxiv.2603.21286,
  title  = {When the Chain Breaks: Interactive Diagnosis of LLM Chain-of-Thought Reasoning Errors},
  author = {Shiwei Chen and Niruthikka Sritharan and Xiaolin Wen and Chenxi Zhang and Xingbo Wang and Yong Wang},
  journal= {arXiv preprint arXiv:2603.21286},
  year   = {2026}
}

备注

Accepted to EuroVis 2026