中文

超越通过或失败:面向目标移动UI导航的基础模型多维度基准测试

软件工程 2025-02-12 v2

摘要

基础模型(FM)的最新进展使得基于高层目标指令的移动应用(app)导航成为可能,并具有重要的工业应用,如UI测试。虽然现有基准测试使用二元通过/失败指标评估基于FM的UI导航,但它们有两个主要局限性:它们无法反映移动UI导航的复杂性质,其中FM可能因各种原因失败(例如,误解指令和规划失败),并且由于任务过于简化、不能很好地代表真实场景,它们缺乏工业相关性。为解决上述局限性,我们提出了Sphinx,一个用于在UI导航工业环境中对FM进行多维度评估的综合基准测试。Sphinx引入了一个专门的工具包,评估五种基本的FM能力,提供关于失败模式(如应用知识不足或规划问题)的详细见解。使用流行的Google Play应用和微信内部UI测试用例,我们评估了8个FM的20种不同配置。我们的结果表明,现有的FM普遍难以应对基于目标的测试任务,主要原因是缺乏UI特定的能力。我们总结了使用Sphinx对FM进行基准测试的七条经验教训,为改进基于FM的移动UI导航提供了明确方向。

关键词

引用

@article{arxiv.2501.02863,
  title  = {Beyond Pass or Fail: Multi-Dimensional Benchmarking of Foundation Models for Goal-based Mobile UI Navigation},
  author = {Dezhi Ran and Mengzhou Wu and Hao Yu and Yuetong Li and Jun Ren and Yuan Cao and Xia Zeng and Haochuan Lu and Zexin Xu and Mengqian Xu and Ting Su and Liangchao Yao and Ting Xiong and Wei Yang and Yuetang Deng and Assaf Marron and David Harel and Tao Xie},
  journal= {arXiv preprint arXiv:2501.02863},
  year   = {2025}
}