Mobile-Aptus:基于 MLLM 的移动使用智能体的置信度驱动的主动且稳健的交互
计算与语言
2026-05-28 v1
摘要
最近的多模态大语言模型(MLLM)在使移动使用智能体能够自主执行人类指令方面显示出卓越的潜力。然而,完全自动化的智能体往往会尝试执行无法解决的任务,从而导致过度执行的问题。以往的研究通过训练交互式移动使用智能体来解决此问题,使智能体在无法完成用户指令时请求人类交互。然而,我们发现这些交互式智能体倾向于表现出过度请求行为,过度依赖人类干预。为缓解过度执行和过度请求的问题,我们提出了一种通用的置信度集成框架,使 MLLM 基于移动使用智能体能够实现置信度驱动的主动且稳健的交互。该框架包含两个阶段:交互能力赋能阶段和置信度偏差纠正阶段。在交互能力赋能阶段,智能体通过监督式微调学习输出动作和置信度分数。在置信度偏差纠正阶段,智能体通过结合语义相似性检索和直接偏好优化来输出更准确的置信度分数。实验结果表明,Mobile-Aptus 在四个流行的移动使用智能体基准(OS-Kairos、AITZ、Meta-GUI 和 AndroidControl)上实现了领先的性能。Mobile-Aptus 在离线基准测试中始终优于所有基线方法,任务成功率平均提高了 17%。在实际动态实验中,Mobile-Aptus 相对于基线方法在任务成功率上提升了 26%,仅需 0.64 次每条指令的干预步骤。代码已公开于 https://github.com/Wuzheng02/Mobile-Aptus。
引用
@article{arxiv.2605.28629,
title = {Mobile-Aptus: Confidence-Driven Proactive and Robust Interaction in MLLM-based Mobile-Using Agents},
author = {Zheng Wu and Pengzhou Cheng and Zongru Wu and Yuan Guo and Tianjie Ju and Aston Zhang and Gongshen Liu and Zhuosheng Zhang},
journal= {arXiv preprint arXiv:2605.28629},
year = {2026}
}
备注
Accepted by TASLP