中文

基于 LLM 的测试生成器所作的设计选择阻碍了其发现缺陷

软件工程 2024-12-19 v1 人工智能

摘要

使用大型语言模型进行自动化测试用例生成的研究和商业工具日益增多。本文批判性地审视了近期基于 LLM 的测试生成工具(如 Codium CoverAgent 和 CoverUp)是否能有效发现缺陷,还是无意中验证了错误代码。考虑到缺陷只能通过失败的测试用例暴露,我们探讨了一个问题:当这些工具的测试预言被设计为通过时,它们能否真正实现软件测试的预期目标?使用真实的人类编写的缺陷代码作为输入,我们评估了这些工具,展示了 LLM 生成的测试如何无法检测到缺陷,更令人担忧的是,其设计如何通过验证生成测试套件中的缺陷并拒绝揭示缺陷的测试而使情况恶化。这些发现对基于 LLM 的测试生成工具背后的设计的有效性及其对软件质量和测试套件可靠性的影响提出了重要质疑。

关键词

引用

@article{arxiv.2412.14137,
  title  = {Design choices made by LLM-based test generators prevent them from finding bugs},
  author = {Noble Saji Mathews and Meiyappan Nagappan},
  journal= {arXiv preprint arXiv:2412.14137},
  year   = {2024}
}