利用大型视觉语言模型提升自动化网页 GUI 测试
软件工程
2024-10-17 v1
摘要
随着 web 技术的快速发展,过去数十年中,越来越多的软件应用已转化为基于 web 的形式。为确保软件质量和用户体验,已提出 various techniques 来自动测试 web 应用程序,通过与其 GUI 交互。为实现高功能覆盖,web GUI 测试工具通常需要生成高质量的文本输入并与关联 GUI 元素(例如,单击提交按钮)进行交互。然而,开发一个解决上述两个子任务的整体方法具有挑战性,因为 web GUI 上下文可能复杂且高度动态,这使得其程序化处理变得困难。最近大型视觉语言模型(LVLM)的发展为处理这些长期存在的问题提供了新的机会。本文提出了 VETL,即首个以 LVLM 为驱动的端到端 web 测试技术。凭借 LVLM 的场景理解能力,VETL 能够生成聚焦于局部上下文的有效且有意义的文本输入,同时无需提取精确的文本属性。关联 GUI 元素的选择被形式化为视觉问答问题,允许 LVLM 基于视觉指令捕获输入框与相关元素之间的逻辑连接。进一步地,GUI 探索由多臂老带臂模块的好奇心导向策略驱动。实验表明,VETL 有效地探索了 web 状态/动作空间并检测到 bug。与当前最先进的 web 测试技术 WebExplor 相比,VETL 在基准网站上可发现 25%更多的独特 web 动作。此外,它还能暴露来自顶级商业网站中的功能性 bug,这些网站的维护者已确认。我们的工作首次尝试在端到端 GUI 测试中利用 LVLM,展示了该研究方向的前景成果。
引用
@article{arxiv.2410.12157,
title = {Leveraging Large Vision Language Model For Better Automatic Web GUI Testing},
author = {Siyi Wang and Sinan Wang and Yujia Fan and Xiaolei Li and Yepang Liu},
journal= {arXiv preprint arXiv:2410.12157},
year = {2024}
}