评估 LLM 在自动化程序修复中的泛化能力
软件工程
2025-03-13 v1 人工智能
摘要
基于 LLM 的自动化程序修复方法因其 SOTA 性能而备受关注。然而,它们主要在 Defects4J 等少数知名数据集上进行评估,这引发了关于它们在新数据集上有效性的疑问。在本研究中,我们在 DEFECTS4J-TRANS 上评估了 11 个性能最优的 LLM,这是一个通过转换 Defects4J 同时保持原始语义而得到的新数据集。在 Defects4J 和 DEFECTS4J-TRANS 上的实验结果表明,所有研究的 LLM 在 APR 任务中的泛化能力有限,在 DEFECTS4J-TRANS 上正确和合理补丁的平均数量分别减少了 49.48% 和 42.90%。对在修复提示中加入额外修复相关信息的进一步调查表明,尽管这些信息显著增强了 LLM 的能力(正确和合理补丁的数量分别增加了 136.67% 和 121.82%),但其性能仍未达到其原始结果。这表明仅靠提示工程不足以大幅提升 LLM 的修复能力。基于我们的研究,我们还为未来的研究提供了几项建议。
引用
@article{arxiv.2503.09217,
title = {Evaluating the Generalizability of LLMs in Automated Program Repair},
author = {Fengjie Li and Jiajun Jiang and Jiajun Sun and Hongyu Zhang},
journal= {arXiv preprint arXiv:2503.09217},
year = {2025}
}
备注
5 pages, 1 figure, to be published in ICSE2025-NIER