SWE-Bench 的幻觉:当最先进 LLM 记住而非推理时
人工智能
2025-12-02 v4 软件工程
摘要
随着大语言模型(LLM)能力不断增强并被广泛采用,基准测试在评估其实际效用方面发挥着核心作用。例如,SWE-Bench Verified 已成为评估 LLM 软件工程能力的关键基准测试,特别是其解决真实 GitHub 问题的能力。最近的 LLM 在 SWE-Bench 上展现出令人瞩目的表现,引发了对其复杂编码能力的乐观预期。然而,当前的评估协议可能高估了这些模型的真实能力。区分 LLM 的可泛化问题解决能力与其他已习得的伪迹至关重要。在本工作中,我们引入了两个诊断任务:仅从问题描述中进行文件路径识别,以及仅利用当前文件上下文和问题描述进行真实函数复现,以探测模型的基础知识。我们提供了经验证据表明,SWE-Bench Verified 上的性能提升可能部分由记忆而非真正的解决问题能力驱动。我们表明,最先进模型仅凭问题描述即可达到高达 76% 的准确率来识别有缺陷的文件路径,而无需访问代码库结构。这一性能在 SWE-Bench 之外仓库的任务上仅为 53%,指向了可能的数据污染或记忆现象。在函数复现任务中也观察到类似的模式,其中逐字相似度在 SWE-Bench Verified 上远高于其他类似编码基准测试(SWE-Bench Verified 和 Full 上连续 5-gram 准确率高达 35%,但在其他基准测试的任务上仅为 18%)。这些发现对现有结果的有效性提出了质疑,并强调了需要更稳健、抗污染的基准测试来可靠评估 LLM 的编码能力。
引用
@article{arxiv.2506.12286,
title = {The SWE-Bench Illusion: When State-of-the-Art LLMs Remember Instead of Reason},
author = {Shanchao Liang and Spandan Garg and Roshanak Zilouchian Moghaddam},
journal= {arXiv preprint arXiv:2506.12286},
year = {2025}
}