面向移动测试的基于任务描述的测试生成:多模态推理
软件工程
2025-09-12 v2
摘要
在 Android GUI 测试中,生成可重放作为测试脚本的任务动作序列是常见做法。可以从用自然语言描述的任务目标生成动作序列和相应的测试脚本,以消除手动编写测试脚本的需求。然而,基于大语言模型(LLM)的现有方法往往难以识别最终动作,要么过早结束,要么在最终屏幕之后继续执行。在本文中,我们引入 VisiDroid,一个基于多模态、LLM 的、多智能体框架,迭代确定下一个动作并利用屏幕的视觉图像来检测任务的完整性。这种多模态方法以两个显著方式增强了我们的模型。首先,这种方法使其能够避免在文本内容alone 提供错误的任务完成指示时过早终止任务。此外,视觉输入有助于工具在 GUI 的变更不直接影响任务完成功能时避免错误,例如字体大小或颜色的调整。其次,多模态方法还确保工具不会在最终屏幕之后继续执行,这些屏幕可能缺乏明确的任务完成文本指示,但会显示表示任务完成的视觉元素,这在 GUI 应用中很常见。我们的评估显示,VisiDroid 实现了 87.3% 的准确率,相对于最佳基线提高了 23.5%。我们还展示了包含图像和文本的多模态框架使 LLM 更好地确定任务何时完成。
引用
@article{arxiv.2504.15917,
title = {Towards Test Generation from Task Description for Mobile Testing with Multi-modal Reasoning},
author = {Hieu Huynh and Hai Phung and Hao Pham and Tien N. Nguyen and Vu Nguyen},
journal= {arXiv preprint arXiv:2504.15917},
year = {2025}
}
备注
Change the method and experimentation