基准测试足够坚固吗?基于突变的回归测试诊断与增强
软件工程
2026-04-03 v1
摘要
以测试套件驱动的基准测试(例如 SWE-bench)已成为衡量自动化问题解决代理效果的事实标准:只要生成的补丁通过随附的回归测试,即可被接受。然而,实际情况下,足不够强的测试套件会容纳合理但语义不正确的补丁,从而夸大报告的成功率。我们引入 STING,一个面向目标化测试增强的框架,使用语义被修改的程序变体作为诊断应力器,以发现并修复基准回归测试的弱点。那些仍通过原始测试的真实补丁变体揭示了受约束不足的行为;这些差距随后指导生成针对性的回归测试。只有当生成的测试 (i) 在真实补丁上通过,(ii) 在至少一个存活于原始测试套件的变体上失败,(iii) 在旨在防止过拟合的行为保持变换下仍有效时,才会被保留。应用于 SWE-bench Verified,STING 发现 77% 的实例至少包含一个存活的变体。STING 生成了1,014个经过验证的测试,覆盖211个实例,并将补丁区域线和分支覆盖率分别提高了10.8%和9.5%。重新评估使用加强测试套件的前10名修复代理,其解决率下降了4.2%-9.0%,这表明相当比例的先前通过补丁是利用基准测试薄弱环节,而非忠实地实现了预期修复。这凸显了可靠的基准评估不仅取决于补丁生成,也同样取决于测试的充分性。
引用
@article{arxiv.2604.01518,
title = {Are Benchmark Tests Strong Enough? Mutation-Guided Diagnosis and Augmentation of Regression Suites},
author = {Chenglin Li and Yisen Xu and Zehao Wang and Shin Hwei Tan and Tse-Hsun and Chen},
journal= {arXiv preprint arXiv:2604.01518},
year = {2026}
}