面向Android应用非崩溃功能性Bug检测的多模态大语言模型研究
软件工程
2024-07-30 v1
摘要
已开发出多种方法,采用各种策略来测试移动应用的图形用户界面(GUI)。然而,传统的GUI测试技术,如随机测试和基于模型的测试,主要侧重于生成能够实现高代码覆盖率的测试序列,但往往难以作为有效的测试信使来检测非崩溃功能性(NCF)Bug。为了克服这些限制,本研究实证研究了利用大语言模型(LLM)作为测试信使来检测Android应用中NCF Bug的能力。我们的直觉是,LLM的训练语料库涵盖了大量的移动应用使用和Bug报告描述,使其在与NCF Bug检测相关的领域知识方面具有优势。我们对在71个已记录的NCF Bug上的LLM作为测试信使的 effectiveness进行了全面实证研究。结果表明,LLM实现了49%的Bug检测率,优于现有用于检测Android应用中NCF Bug的工具。此外,通过利用LLM作为测试信使,我们成功检测到了64个Android应用中24个previously未知的NCF Bug,其中4个Bug被确认或修复。然而,我们也识别出LLM的局限性,主要与性能下降、固有的随机性和误报有关。我们的研究表明,利用LLM作为测试信使用于Android NCF Bug检测具有潜力,并为未来的研究指出了方向。
引用
@article{arxiv.2407.19053,
title = {A Study of Using Multimodal LLMs for Non-Crash Functional Bug Detection in Android Apps},
author = {Bangyan Ju and Jin Yang and Tingting Yu and Tamerlan Abdullayev and Yuanyuan Wu and Dingbang Wang and Yu Zhao},
journal= {arXiv preprint arXiv:2407.19053},
year = {2024}
}