自动化 Web 代理是否是良好的测试者?
软件工程
2025-04-03 v1
摘要
尽管自动化测试取得了进展,手动测试仍然普遍存在,因为测试脚本的脆弱性带来了高维护成本——脚本常因应用结构的微小变化而中断。近期大型语言模型(LLM)的发展为可能的替代方案提供了动力,使能够自主与应用程序交互的自主 Web 代理(Autonomous Web Agents, AWAs)成为可能。这些代理可作为自主测试代理(Autonomous Test Agents, ATAs)使用,可能通过类似人类测试员使用的自然语言指令来减少对维护负担重的自动化脚本的需求。本文调查了将 AWAs 适用于自然语言测试用例执行及其评估方法的可行性。我们贡献了:(1) 一个包含三个离线 Web 应用程序的基准,以及 113 个手动测试用例的套组,这些用例分为通过和失败用例,用于评估和比较 ATAs 的性能;(2) SeeAct-ATA 和 pinATA,两个能够执行测试步骤、验证断言并给出判断的开源 ATA 实现;(3) 使用我们基准进行的比较实验,量化了我们 ATAs 的有效性。最后我们还对 PinATA 进行了定性评估,以识别其局限性。我们的发现表明,我们简单的实现 SeeAct-ATA 在执行测试用例方面不如我们更先进的 PinATA 实现——实现了 50% 的性能提升。然而,尽管 PinATA 获得约 60% 的正确判断并达到令人振奋的 94% 的特异性,我们仍识别出需要解决的若干局限性,以发展更具韧性和可靠性的 ATAs,为稳健、低维护的测试自动化铺平了道路。
关键词
引用
@article{arxiv.2504.01495,
title = {Are Autonomous Web Agents Good Testers?},
author = {Antoine Chevrot and Alexandre Vernotte and Jean-Rémy Falleri and Xavier Blanc and Bruno Legeard},
journal= {arXiv preprint arXiv:2504.01495},
year = {2025}
}