仅看屏幕:多模态动作链智能体
计算与语言
2024-06-10 v4 人工智能
人机交互
摘要
自主图形用户界面(GUI)智能体旨在通过无需人工干预地与用户界面交互来便利任务自动化。近期研究已探索激发大语言模型(LLMs)的能力以在多样环境中有效参与。为契合 LLMs 的输入-输出要求,多数现有方法在沙盒设定下开发,依赖外部工具与特定应用的 API 将环境解析为文本元素并解释预测动作。因此,这些方法常受推理低效与错误传播风险困扰。为缓解这些挑战,我们引入 Auto-GUI,一种直接与界面交互、绕过环境解析或依赖应用相关 API 的多模态方案。此外,我们提出一种动作链技术——利用一系列中间历史动作与未来动作规划——以帮助智能体决定执行何种动作。我们在一个含 30 条独立指令的新设备控制基准 AITW 上评估我们的方法,涵盖应用操作、网页搜索与网购等多步任务。实验结果表明 Auto-GUI 取得了最先进性能,动作类型预测准确率达 90\%,整体动作成功率达 74\%。代码公开于 https://github.com/cooelf/Auto-GUI。
引用
@article{arxiv.2309.11436,
title = {You Only Look at Screens: Multimodal Chain-of-Action Agents},
author = {Zhuosheng Zhang and Aston Zhang},
journal= {arXiv preprint arXiv:2309.11436},
year = {2024}
}
备注
Findings of ACL 2024