快速领会:从人类演示中获取隐式意图以构建个性化移动操作智能体
计算与语言
2026-04-06 v2
摘要
随着多模态大语言模型的快速发展,通过使用模仿人类图形用户界面交互的移动操作智能体来实现移动任务的自动化已变得越来越可行。为了进一步增强移动操作智能体,先前的研究采用演示学习从人类演示中改进移动操作智能体。然而,这些方法仅关注人类的显式意图流(例如,步骤序列),而忽略了隐式意图流(例如,个人偏好),这使得构建个性化的移动操作智能体变得困难。在这项工作中,为了评估移动操作智能体与人类之间的意图对齐率,我们首先收集了 MobileIAR,一个包含与人类意图对齐的动作和真实动作的数据集。这使得能够全面评估智能体对人类意图的理解。然后,我们提出了 IFRAgent,一个基于从人类演示中进行意图流识别的框架。IFRAgent 分析来自人类演示的显式意图流,以构建标准操作程序的查询级向量库,并分析隐式意图流以构建用户级习惯库。然后,IFRAgent 利用一个结合了检索增强生成的标准操作程序提取器和一个查询重写器,从原始的模糊查询中生成个性化的查询和标准操作程序,从而增强移动操作智能体与人类意图之间的对齐。实验结果表明,IFRAgent 在人类意图对齐率上平均优于基线 6.79%(相对提升 32.06%),并将步骤完成率平均提高了 5.30%(相对提升 26.34%)。代码可在 https://github.com/MadeAgents/Quick-on-the-Uptake 获取。
引用
@article{arxiv.2508.08645,
title = {Quick on the Uptake: Eliciting Implicit Intents from Human Demonstrations for Personalized Mobile-Use Agents},
author = {Zheng Wu and Heyuan Huang and Yanjia Yang and Yuanyi Song and Xingyu Lou and Weiwen Liu and Weinan Zhang and Jun Wang and Zhuosheng Zhang},
journal= {arXiv preprint arXiv:2508.08645},
year = {2026}
}