中文

超越ChatGPT:多样化大语言模型与验证技术在软件质量保证任务中的提升

软件工程 2024-09-04 v1

摘要

随着大型语言模型(LLM)的发展,其在软件质量保证(SQA)中的应用日益增多。然而,这些应用的当前关注力主要集中在ChatGPT上。仍存缺口在于理解各种大语言模型在这一关键领域的性能表现。本文旨在通过对几种大语言模型在两个SQA任务(故障定位和漏洞检测)中的能力进行全面调查来弥合这一缺口。我们使用GPT-3.5、GPT-4o以及四个其他公开可用大语言模型(LLaMA-3-70B、LLaMA-3-8B、Gemma-7B和Mixtral-8x7B)进行比较研究,以评估它们在这些任务中的有效性。我们的发现表明,several大语言模型在两个任务中均可超越GPT-3.5。此外,,即使是表现较低的大语言模型也提供了独特的正确预测,暗示了结合不同大语言模型结果以提升整体性能的潜力。通过实施一种投票机制来组合大语言模型的结果,我们在两个任务中均相对于GPT-3.5实现了超过10%的提升。此外,我们引入了一种交叉验证方法,通过使用验证提示符将一个大语言模型的答案与另一个大语言模型的答案进行验证来细化大语言模型的答案。这种方法相对于GPT-3.5在故障定位和漏洞检测中分别实现了16%和12%的性能提升,相对于表现最好的大语言模型实现了4%的提升。我们的分析还表明,大语言模型结果中包含解释的程度会影响交叉验证技术的有效性。

关键词

引用

@article{arxiv.2409.01001,
  title  = {Beyond ChatGPT: Enhancing Software Quality Assurance Tasks with Diverse LLMs and Validation Techniques},
  author = {Ratnadira Widyasari and David Lo and Lizi Liao},
  journal= {arXiv preprint arXiv:2409.01001},
  year   = {2024}
}