OmniACT:用于赋能桌面和 Web 多模态通用自主智能体的数据集与基准
人工智能
2024-07-23 v3 计算与语言
计算机视觉与模式识别
人机交互
摘要
几十年来,人机交互本质上一直是手动的。即使在今天,计算机上完成的几乎所有生产性工作都需要人类在每一步进行输入。自主虚拟智能体代表了自动化许多此类琐碎任务的一个令人兴奋的步骤。虚拟智能体将使技术能力有限的用户能够充分利用计算机系统的全部潜力。它们还能以最少的人工干预实现从日历管理到复杂旅行预订等众多计算机任务的高效简化。在本文中,我们介绍了 OmniACT,这是首个用于评估智能体生成可执行程序以完成计算机任务能力的数据集和基准。我们的范围超越了传统的 Web 自动化,涵盖了各种桌面应用程序。该数据集包含诸如“播放下一首歌曲”等基本任务,以及诸如“给 John Doe 发送一封提及见面时间和地点的电子邮件”等长程任务。具体而言,给定一对屏幕图像和视觉定位的自然语言任务,目标是生成一个能够完全执行该任务的脚本。我们在基准上运行了几个强大的基线语言模型智能体。最强的基线 GPT-4 在我们的基准上表现最佳,然而,其性能水平仅达到人类在生成能够完成任务的可执行脚本方面的熟练程度的 15%,这表明了该任务对传统 Web 智能体的挑战性。我们的基准提供了一个平台来衡量和评估语言模型智能体在自动化计算机任务方面的进展,并激励未来的工作致力于构建连接大型语言模型和计算机屏幕视觉定位的多模态模型。
引用
@article{arxiv.2402.17553,
title = {OmniACT: A Dataset and Benchmark for Enabling Multimodal Generalist Autonomous Agents for Desktop and Web},
author = {Raghav Kapoor and Yash Parag Butala and Melisa Russak and Jing Yu Koh and Kiran Kamble and Waseem Alshikh and Ruslan Salakhutdinov},
journal= {arXiv preprint arXiv:2402.17553},
year = {2024}
}