LLM 是否需要看到万物?基于屏幕文本与截图的手机自动化基准测试与故障研究
人机交互
2026-04-21 v1 人工智能
多智能体系统
摘要
随着大语言模型(LLM)的快速发展,移动智能体已成为手机自动化的有前景的工具,模拟人类在屏幕上的交互以完成复杂任务。然而,这些智能体常因准确率低、对用户指令误解以及在挑战性任务上失败而受限,目前对其为何处于失败状态的探讨有限。为此,我们引入 DailyDroid,一个包含 75 个任务的基准测试,覆盖五个场景中的 25 个 Android 应用,分为三个难度级别以模拟日常智能手机使用。我们使用仅文本输入和多模态(文本+截图)输入在 GPT-4o 和 o4-mini 上进行评估,进行 300 次试验,结果显示两者性能相当,多模态输入略提高了成功率。通过深入的故障分析,我们整理出常见故障的手册。我们的发现揭示了 UI 可访问性、输入模态以及 LLM/应用设计方面的关键问题,为未来的移动智能体、应用程序和 UI 开发提供了启示。
引用
@article{arxiv.2604.17817,
title = {Do LLMs Need to See Everything? A Benchmark and Study of Failures in LLM-driven Smartphone Automation using Screentext vs. Screenshots},
author = {Shiquan Zhang and Tianyi Zhang and Le Fang and Simon D'Alfonso and Hong Jia and Vassilis Kostakos},
journal= {arXiv preprint arXiv:2604.17817},
year = {2026}
}
备注
29 pages. This study was conducted around May, 2025