BloomAPR:基于布卢姆分类学的评估大语言模型驱动的程序修复解决方案能力框架
摘要
近期大型语言模型(LLM)的进展加速了 AI 驱动的自动化程序修复(APR)解决方案的开发。然而,这些解决方案通常使用静态基准测试(如 Defects4J 和 SWE-bench),后者存在两个关键局限性:(1)数据污染风险,可能因与 LLM 训练数据重叠而夸大评估结果;(2)有限的能力评估 dynamic 和多样化的上下文。本文引入了 BloomAPR,一个基于布卢姆分类学的 dynamic 评估框架。我们的 framework 提供了一种结构化方法,用于评估 LLM 驱动的 APR solution 在 progressively复杂 reasoning 水平上的认知能力。以 Defects4J 为案例研究,我们在三个不同的 LLM 上评估了两个最先进的 LLM 驱动的 APR solution,分别是 ChatRepair 和 CigaR:GPT-3.5-Turbo、Llama-3.1 和 StarCoder-2。我们的发现表明,这些 solution 在 basic reasoning 能力和有效记忆 bug 修复模式方面表现出色(在 Remember 层级修复最高可达 81.57% 的 bug),其性能随合成生成的 bug 而提升(在 Understand 层级提升最高可达 60.66%),但在 minor syntactic change 上表现较差(在 Apply 层级修复最高仅 43.32%),且在注入到真实世界项目中的类似 bug 时 struggle 较大(在 Analyze 层级仅解决 13.46% 到 41.34% 的 bug)。这些结果凸显了演进基准测试的紧迫性,并为更可信的 LLM 驱动软件工程 solution 评估奠定了基础。
引用
@article{arxiv.2509.25465,
title = {BloomAPR: A Bloom's Taxonomy-based Framework for Assessing the Capabilities of LLM-Powered APR Solutions},
author = {Yinghang Ma and Jiho Shin and Leuson Da Silva and Zhen Ming and Jiang and Song Wang and Foutse Khomh and Shin Hwei Tan},
journal= {arXiv preprint arXiv:2509.25465},
year = {2025}
}
备注
22 pages, 7 figures, Manuscript submitted to ACM Transactions on Software Engineering and Methodology