链路思考推理对移动 GUI 智能体有效性实证研究
人工智能
2025-03-24 v1
摘要
推理能力显著提升了视觉语言模型(VLM)在数学解题、编码和视觉问答等领域的性能,但其在实际应用中的影响尚不明确。本文首次对推理增强型 VLM 在移动 GUI 智能体中的有效性进行实证研究,此类任务需要解释复杂的屏幕布局、理解用户指令并执行多轮交互。我们评估了两组商业模型——Gemini 2.0 Flash 与 Claude 3.7 Sonnet,比较其基础版本与推理增强版本在两个静态基准(ScreenSpot 与 AndroidControl)和一个交互式环境(AndroidWorld)中的表现。我们惊讶地发现,Claude 3.7 Sonnet 的推理模型在 AndroidWorld 上实现了最高的性能。然而,推理 VLM 在静态基准上仅对非推理模型提供有限的提升,甚至在某些智能体设置下会导致性能下降。值得注意的是,推理和非推理 VLM 在不同任务上的失败模式各不相同,这表明推理确实产生了影响,但其收益与代价相互抵消。我们将这些现象归因于基准测试和 VLM 的局限性。基于研究结果,我们就如何在基准测试、VLM 及其在动态调用推理能力方面提供提升建议。实验数据已公开于 https://github.com/LlamaTouch/VLM-Reasoning-Traces。
引用
@article{arxiv.2503.16788,
title = {Does Chain-of-Thought Reasoning Help Mobile GUI Agent? An Empirical Study},
author = {Li Zhang and Longxi Gao and Mengwei Xu},
journal= {arXiv preprint arXiv:2503.16788},
year = {2025}
}