利用基于检索的LLM实现经济高效的UI自动化测试:微信案例研究
软件工程
2024-09-13 v1
摘要
UI自动化测试在确保移动应用质量方面发挥着关键作用。尽管使用机器学习技术生成这些测试越来越流行,但它们仍然面临一些挑战,例如UI元素的不匹配。大型语言模型(LLM)的最新进展通过利用其语义理解能力解决了这些问题。然而,在将这些模型应用于工业级应用测试方面仍存在显著差距,特别是在成本优化和知识限制方面。为了解决这个问题,我们引入了CAT,通过结合机器学习和LLM与最佳实践,为工业应用创建经济高效的UI自动化测试。给定任务描述,CAT采用检索增强生成(RAG)来获取工业应用使用示例作为少样本学习上下文,帮助LLM生成具体的动作序列。然后,CAT采用机器学习技术,以LLM作为补充优化器,将目标元素映射到UI屏幕上。我们在微信测试数据集上的评估证明了CAT的性能和成本效益,以0.34美元的成本实现了90%的UI自动化,超越了现有技术水平。我们还将我们的方法集成到真实的微信测试平台中,展示了其在检测141个错误和增强开发者测试过程中的实用性。
引用
@article{arxiv.2409.07829,
title = {Enabling Cost-Effective UI Automation Testing with Retrieval-Based LLMs: A Case Study in WeChat},
author = {Sidong Feng and Haochuan Lu and Jianqin Jiang and Ting Xiong and Likun Huang and Yinglin Liang and Xiaoqin Li and Yuetang Deng and Aldeida Aleti},
journal= {arXiv preprint arXiv:2409.07829},
year = {2024}
}