中文

MMInA:多跳多模态互联网智能体基准测试

计算机视觉与模式识别 2025-07-01 v2 人工智能 计算与语言

摘要

自主的具身智能体生活在由多媒体网站构成的互联网上。它们能在多模态网站之间跳转以完成复杂的用户任务吗?现有的基准测试未能在一个现实的、不断演化的环境中评估它们跨网站的具身能力。为了回答这个问题,我们提出了 MMInA,一个多跳且多模态的基准测试,用于评估具身智能体执行组合式互联网任务的能力,它具有几个吸引人的特性:1) 不断演化的真实世界多模态网站。我们的基准测试独特地在不断演化的真实世界网站上运行,确保了高度的真实性以及对自然用户任务的适用性。我们的数据包含 1,050 个人类编写的任务,涵盖购物和旅行等多个领域,每个任务要求智能体从网页中自主提取多模态信息作为观察;2) 多跳网页浏览。我们的数据集具有自然的组合式任务,需要来自多个网站的信息或对多个网站执行操作才能解决,以评估在网页任务上的长程推理能力;3) 综合评估。我们提出了一种新的协议来评估智能体在完成多跳任务方面的进展。我们实验了独立(多模态)语言模型和基于启发式的网页智能体。大量实验表明,虽然长链多跳网页任务对人类来说很容易,但对最先进的网页智能体仍然具有挑战性。我们发现,在解决具有更多跳数的任务时,智能体更容易在早期跳数失败,从而导致任务成功率降低。为了解决这个问题,我们提出了一种简单的记忆增强方法,重放过去的动作轨迹进行反思。我们的方法显著提高了单跳和多跳网页浏览能力的性能。我们的代码和数据可在 github.com/shulin16/MMInA 获取。

关键词

引用

@article{arxiv.2404.09992,
  title  = {MMInA: Benchmarking Multihop Multimodal Internet Agents},
  author = {Shulin Tian and Ziniu Zhang and Liangyu Chen and Ziwei Liu},
  journal= {arXiv preprint arXiv:2404.09992},
  year   = {2025}
}

备注

ACL 2025 findings. The live leaderboard is at https://mmina.cliangyu.com/