中文

XUAT-Copilot:基于大语言模型的自动化用户验收测试多智能体协作系统

人工智能 2024-01-11 v2

摘要

在过去几年中,我们致力于自动化微信支付(中国最具影响力的移动支付应用之一)的用户验收测试(UAT)流程。为此开发了一个名为 XUAT 的系统。然而,当前系统中仍存在一个劳动密集型阶段,即测试脚本生成。因此,在本文中,我们专注于提升当前系统自动化水平的方法,特别是测试脚本生成阶段。随着近期的显著成功,大语言模型(LLMs)在实现类人智能方面展现出巨大潜力,并且越来越多的研究领域开始利用 LLMs 作为自主智能体以获得类人决策能力。受这些工作的启发,我们提出了一种由 LLM 驱动的多智能体协作系统,名为 XUAT-Copilot,用于自动化 UAT。所提出的系统主要由三个基于 LLM 的智能体组成,分别负责动作规划、状态检查和参数选择,以及两个用于状态感知和用例重写的附加模块。这些智能体以协作方式与测试设备交互,做出类人决策并生成动作命令。所提出的多智能体系统在我们的实验研究中达到了与人类测试员相近的有效性,并且与单智能体架构相比,Pass@1 准确率获得了显著提升。更重要的是,该系统已在微信支付移动应用的正式测试环境中上线,在日常开发工作中节省了大量人力。

关键词

引用

@article{arxiv.2401.02705,
  title  = {XUAT-Copilot: Multi-Agent Collaborative System for Automated User Acceptance Testing with Large Language Model},
  author = {Zhitao Wang and Wei Wang and Zirao Li and Long Wang and Can Yi and Xinjie Xu and Luyang Cao and Hanjing Su and Shouzhi Chen and Jun Zhou},
  journal= {arXiv preprint arXiv:2401.02705},
  year   = {2024}
}