中文

LLM 是否需要看到万物?基于屏幕文本与截图的手机自动化基准测试与故障研究

人机交互 2026-04-21 v1 人工智能 多智能体系统

摘要

随着大语言模型(LLM)的快速发展,移动智能体已成为手机自动化的有前景的工具,模拟人类在屏幕上的交互以完成复杂任务。然而,这些智能体常因准确率低、对用户指令误解以及在挑战性任务上失败而受限,目前对其为何处于失败状态的探讨有限。为此,我们引入 DailyDroid,一个包含 75 个任务的基准测试,覆盖五个场景中的 25 个 Android 应用,分为三个难度级别以模拟日常智能手机使用。我们使用仅文本输入和多模态(文本+截图)输入在 GPT-4o 和 o4-mini 上进行评估,进行 300 次试验,结果显示两者性能相当,多模态输入略提高了成功率。通过深入的故障分析,我们整理出常见故障的手册。我们的发现揭示了 UI 可访问性、输入模态以及 LLM/应用设计方面的关键问题,为未来的移动智能体、应用程序和 UI 开发提供了启示。

关键词

引用

@article{arxiv.2604.17817,
  title  = {Do LLMs Need to See Everything? A Benchmark and Study of Failures in LLM-driven Smartphone Automation using Screentext vs. Screenshots},
  author = {Shiquan Zhang and Tianyi Zhang and Le Fang and Simon D'Alfonso and Hong Jia and Vassilis Kostakos},
  journal= {arXiv preprint arXiv:2604.17817},
  year   = {2026}
}

备注

29 pages. This study was conducted around May, 2025