中文

你不知道直到点击:面向生产就绪软件的自动化 GUI 测试评估

软件工程 2025-08-21 v1 人工智能

摘要

大型语言模型(LLM)和代码智能体在软件开发中的应用正快速演进,从生成孤立的代码片段,发展到生产完整的软件应用程序,包括图形界面、交互逻辑和动态行为。然而,当前的基准测试在评估此类生产就绪软件方面仍显不足,因其常依赖静态检查或二元通过/失败脚本,无法捕捉定义真实世界可用性的交互行为和运行时动态——这些特征只有在应用程序被主动使用时才会显现。这是当前评估的盲区:只有经过点击、交互并观察其响应方式,才能判断应用程序是否正常工作。为弥合这一差距,我们引入了 RealDevWorld,这是一个用于自动化端到端评估 LLM 生成生产就绪仓库能力的新型评估框架。该框架包含两个关键组件:(1)RealDevBench,一个跨越多个领域的包含 194 个开放式软件工程任务的多样化集合,融合多模态元素以反映真实世界的复杂性;(2)AppEvalPilot,一个新的代理评判评估系统,模拟真实且基于 GUI 的用户交互,以自动化和整体方式评估软件的功能正确性、视觉保真度和运行时行为。该框架提供细粒度、任务特定的诊断性反馈,支持超越简单成功/失败判断的细致评估。实证结果表明,RealDevWorld 能有效、自动且与人类评估高度一致,实现 0.92 的准确率和 0.85 的相关性,同时显著减少对手动审查的依赖。这使得对 LLM 生成的生产级软件进行可扩展且人类对齐的评估成为可能。我们的代码已在 GitHub 上提供。

关键词

引用

@article{arxiv.2508.14104,
  title  = {You Don't Know Until You Click:Automated GUI Testing for Production-Ready Software Evaluation},
  author = {Yutong Bian and Xianhao Lin and Yupeng Xie and Tianyang Liu and Mingchen Zhuge and Siyuan Lu and Haoming Tang and Jinlin Wang and Jiayi Zhang and Jiaqi Chen and Xiangru Tang and Yongxin Ni and Sirui Hong and Chenglin Wu},
  journal= {arXiv preprint arXiv:2508.14104},
  year   = {2025}
}