CoCo-Agent:用于智能手机 GUI 自动化的综合认知多模态大语言模型智能体
计算与语言
2024-06-04 v3
摘要
多模态大语言模型 (MLLMs) 作为类人自主语言智能体与现实世界环境交互方面显示出巨大潜力,特别是在图形用户界面 (GUI) 自动化方面。然而,这些 GUI 智能体需要全面的认知能力,包括详尽的感知和可靠的动作响应。我们提出了一种综合认知大语言模型智能体 CoCo-Agent,采用两种新颖方法:综合环境感知 (CEP) 和条件动作预测 (CAP),以系统地提高 GUI 自动化性能。首先,CEP 通过不同方面和粒度促进 GUI 感知,包括视觉通道的截图和互补详细布局,以及文本通道的历史动作。其次,CAP 将动作预测分解为子问题:动作类型预测和基于动作类型的动作目标预测。凭借我们的技术设计,我们的智能体在 AITW 和 META-GUI 基准测试上取得了新的最先进性能,展示了在现实场景中的前景能力。代码可在 https://github.com/xbmxb/CoCo-Agent 获取。
引用
@article{arxiv.2402.11941,
title = {CoCo-Agent: A Comprehensive Cognitive MLLM Agent for Smartphone GUI Automation},
author = {Xinbei Ma and Zhuosheng Zhang and Hai Zhao},
journal= {arXiv preprint arXiv:2402.11941},
year = {2024}
}
备注
ACL'2024 Findings