Android in the Zoo: 面向GUI代理的链式动作思维
计算与语言
2024-07-16 v2 计算机视觉与模式识别
人机交互
机器学习
摘要
大语言模型(LLM)引发了智能手机自主GUI代理的激增,这些代理通过预测一系列API动作来完成自然语言触发的任务。尽管任务高度依赖过去的动作和视觉观察,现有研究通常很少考虑中间截图和屏幕操作所携带的语义信息。为了解决这个问题,本文提出了链式动作思维(CoAT),它包含了先前动作的描述、当前屏幕,更重要的是,关于应该执行什么动作以及所选动作导致的结果的动作思维。我们证明,在三个现成LMM的零样本设置下,与先前提出的上下文建模相比,CoAT显著改进了动作预测。为了进一步促进这方面的研究,我们构建了一个数据集Android-In-The-Zoo (AitZ),包含18,643个屏幕-动作对以及链式动作思维注释。实验表明,在我们的AitZ数据集上微调一个1B模型(即AUTO-UI-base)达到了与CogAgent-Chat-18B相当的性能。
引用
@article{arxiv.2403.02713,
title = {Android in the Zoo: Chain-of-Action-Thought for GUI Agents},
author = {Jiwen Zhang and Jihao Wu and Yihua Teng and Minghui Liao and Nuo Xu and Xiao Xiao and Zhongyu Wei and Duyu Tang},
journal= {arXiv preprint arXiv:2403.02713},
year = {2024}
}
备注
Dataset could be found in https://github.com/IMNearth/CoAT