中文

GPT-4V(ision):若加以锚定,即为通用网络智能体

信息检索 2024-03-14 v2 人工智能 计算与语言 计算机视觉与模式识别

摘要

近期大型多模态模型(LMMs)的发展,尤其是 GPT-4V(ision) 和 Gemini,正迅速将多模态模型的能力边界扩展到图像描述和视觉问答等传统任务之外。本工作探索了 GPT-4V 等 LMM 作为通用网络智能体的潜力,使其能够遵循自然语言指令在任意给定网站上完成任务。我们提出了 SEEACT,一个利用 LMM 的强大能力实现集成视觉理解与网络操作的通用网络智能体。我们在最新的 MIND2WEB 基准上进行了评估。除了在缓存网站上进行标准的离线评估外,我们还开发了一个工具,允许网络智能体在实时网站上运行,从而实现了新的在线评估设置。我们表明,GPT-4V 展现出作为网络智能体的巨大潜力——如果我们将它的文本计划手动锚定(ground)为网站上的操作,它可以成功完成实时网站上 51.1% 的任务。这显著优于纯文本 LLM(如 GPT-4)或专门为网络智能体微调的较小模型(FLAN-T5 和 BLIP-2)。然而,锚定仍然是一个主要挑战。现有的 LMM 锚定策略(如标记集提示)对网络智能体效果不佳,而我们在本文中开发的最佳锚定策略同时利用了 HTML 结构和视觉信息。尽管如此,与理想锚定相比仍存在显著差距,留有充足的改进空间。所有代码、数据和评估工具均可在 https://github.com/OSU-NLP-Group/SeeAct 获取。

关键词

引用

@article{arxiv.2401.01614,
  title  = {GPT-4V(ision) is a Generalist Web Agent, if Grounded},
  author = {Boyuan Zheng and Boyu Gou and Jihyung Kil and Huan Sun and Yu Su},
  journal= {arXiv preprint arXiv:2401.01614},
  year   = {2024}
}