InquireMobile:通过强化微调教授基于VLM的移动智能体请求人类协助
人工智能
2026-04-28 v2
摘要
视觉语言模型(VLMs)的最新进展使移动智能体能够基于人类指令感知和与真实世界的移动环境进行交互。然而,当前完全自主的范式在模型理解或推理能力不足时存在潜在的安全风险。为应对这一挑战,我们首先引入了InquireBench,一个专门设计用于评估移动智能体安全交互与主动询问用户能力的综合基准,涵盖5个类别和22个子类别,其中大多数现有的VLM智能体表现出接近零的性能。在本文中,我们旨在开发一个在关键决策点主动寻求人类确认交互系统。为此,我们提出了InquireMobile,一个受强化学习启发的新型模型,具有两阶段训练策略和交互式预动作推理机制。最后,我们的模型在InquireBench上实现了46.8%的询问成功率提升,并在现有基线中取得了最佳的整体成功率。我们将开源所有数据集、模型和评估代码,以促进学术界和工业界的开发。
引用
@article{arxiv.2508.19679,
title = {InquireMobile: Teaching VLM-based Mobile Agent to Request Human Assistance via Reinforcement Fine-Tuning},
author = {Qihang Ai and Pi Bu and Yue Cao and Yingyao Wang and Jihao Gu and Jingxuan Xing and Zekun Zhu and Wei Jiang and Zhicheng Zheng and Jun Song and Yuning Jiang},
journal= {arXiv preprint arXiv:2508.19679},
year = {2026}
}
备注
15 pages, 10 figures