关于LLM生成的工业与开源数据库管理系统测试的脆弱性
软件工程
2026-01-15 v1
摘要
脆弱测试是软件测试中的一个常见问题。它们在相同代码上多次执行时会产生不一致的结果,从而使测试失败表明软件缺陷的假设失效。最近关于基于LLM的测试生成的工作已将脆弱性确定为生成测试的潜在问题。然而,其普遍性和根本原因尚不清楚。我们检查了LLM生成的测试在四个关系数据库管理系统中的脆弱性:SAP HANA、DuckDB、MySQL和SQLite。我们使用两个LLM,GPT-4o和Mistral-Large-Instruct-2407,扩增了测试套件,以评估生成测试用例的脆弱性。我们的结果表明,与现有测试相比,生成的测试具有略高的脆弱测试比例。基于手动检查,我们发现脆弱性最常见的根本原因是测试依赖于不保证的特定顺序(“无序集合”),这在115个脆弱测试中出现了72个(63%)。此外,两个LLM都通过提供的提示上下文将脆弱性从现有测试转移到了新生成的测试中。我们的实验表明,脆弱性转移在SAP HANA等闭源系统中比在开源系统中更为普遍。我们的研究为开发人员提供了关于LLM生成的测试可能出现的脆弱性类型的参考。它还强调了在使用LLM进行测试生成时,为LLM提供定制上下文的重要性。
引用
@article{arxiv.2601.08998,
title = {On the Flakiness of LLM-Generated Tests for Industrial and Open-Source Database Management Systems},
author = {Alexander Berndt and Thomas Bach and Rainer Gemulla and Marcus Kessel and Sebastian Baltes},
journal= {arXiv preprint arXiv:2601.08998},
year = {2026}
}
备注
12 pages, 5 tables, 3 figures, accepted at the 48th International Conference on Software Engineering: Software Engineering in Practice (ICSE SEIP 2026)