说一套,做一套?诊断 VLM 驱动的移动使用智能体中的推理-执行差距
计算与语言
2025-10-03 v1
摘要
由视觉语言模型(VLM)驱动的移动使用智能体在解释自然语言指令并基于移动图形用户界面生成相应动作方面展现了巨大潜力。近期研究表明,引入思维链(CoT)推理往往能提高执行准确性。然而,现有评估强调执行准确性,而忽视了 CoT 推理是否与真实动作对齐。这一疏忽未能评估潜在的推理-执行差距,进而导致过度信任:用户依赖看似合理的 CoT 可能不知不觉地授权有害操作,可能导致财务损失或信任危机。在本工作中,我们引入了一种新的评估框架来诊断推理-执行差距。其核心是真实对齐(GTA),它衡量 CoT 所暗示的动作是否与真实动作一致。通过将 GTA 与标准精确匹配(EM)指标相结合,我们同时评估推理准确性和执行准确性。这一联合视角揭示了两种推理-执行差距:(i)执行差距(EG),即推理正确识别了正确动作但执行失败,以及(ii)推理差距(RG),即执行成功但推理过程与实际执行相冲突。在广泛的移动交互任务上的实验结果表明,推理-执行差距普遍存在,执行差距的发生频率高于推理差距。此外,尽管扩大模型规模减少了整体差距,但即使在最大的模型中仍存在显著的执行差距。进一步分析表明,我们的框架可靠地反映了最先进模型中系统性的 EG/RG 模式。这些发现提供了具体的诊断信息,并支持开发更可信的移动使用智能体。
引用
@article{arxiv.2510.02204,
title = {Say One Thing, Do Another? Diagnosing Reasoning-Execution Gaps in VLM-Powered Mobile-Use Agents},
author = {Lingzhong Dong and Ziqi Zhou and Shuaibo Yang and Haiyue Sheng and Pengzhou Cheng and Zongru Wu and Zheng Wu and Gongshen Liu and Zhuosheng Zhang},
journal= {arXiv preprint arXiv:2510.02204},
year = {2025}
}