中文

增强LLM代码调试的双过程脚手架推理

人工智能 2025-11-12 v1 计算与语言 软件工程

摘要

最近的大型语言模型(LLM)通过先进的推理算法在各种基准测试上展示出复杂的问题解决能力,但识别在复杂性和计算效率之间取得平衡的推理步骤的关键问题仍未得到解决。近期研究越来越多地借鉴心理学理论,以探索优化认知通道的策略。将LLM的最终输出和中间步骤分别视为系统1和系统2。然而,对系统2推理的深入探索仍不足。因此,我们提出一种基于心理学的脚手架推理框架,用于代码调试,该框架包括脚手架流、分析流和集成流。脚手架流中参考代码的构建与分析流产生的有故障代码分析结果通过集成流相互结合。我们的框架在DebugBench上实现了88.91%的通过率,平均推理时间为5.36秒/问题,凭借在各种LLM上的推理准确率和效率均优于其他推理方法。进一步的分析阐明了在不同问题难度和故障类型下的各种认知通道的优势和局限性。我们的发现也证实了所提出的脚手架推理框架与人类认知过程的一致性。

关键词

引用

@article{arxiv.2511.08052,
  title  = {Dual-Process Scaffold Reasoning for Enhancing LLM Code Debugging},
  author = {Po-Chung Hsieh and Chin-Po Chen and Jeng-Lin Li and Ming-Ching Chang},
  journal= {arXiv preprint arXiv:2511.08052},
  year   = {2025}
}

备注

5 pages, 2 figures