中文

InfantAgent-Next:用于自动计算机交互的多模态通用智能体

人工智能 2026-05-04 v3

摘要

本文介绍了\textsc{InfantAgent-Next}——一个能够以多模态方式与计算机交互的通用智能体,涵盖文本、图像、音频和视频。与现有方法仅构建针对单一大模型的复杂工作流程或仅提供工作流程模块化不同的是,我们的智能体在高度模块化的架构中集成了基于工具的智能体和纯视觉智能体,使不同模型能够分步骤协作解决解耦任务。我们通过能够评估纯视觉基于真实世界基准测试(即OSWorld)以及更通用或工具密集型基准测试(如GAIA和SWE-Bench)的普遍性,展示了我们的能力。具体而言,我们在OSWorld上实现了7.27%\mathbf{7.27\%}的准确率,超越Claude-Computer-Use。代码和评估脚本已开源于https://github.com/bin123apple/InfantAgent。

关键词

引用

@article{arxiv.2505.10887,
  title  = {InfantAgent-Next: A Multimodal Generalist Agent for Automated Computer Interaction},
  author = {Bin Lei and Weitai Kang and Zijian Zhang and Winson Chen and Xi Xie and Shan Zuo and Mimi Xie and Ali Payani and Mingyi Hong and Yan Yan and Caiwen Ding},
  journal= {arXiv preprint arXiv:2505.10887},
  year   = {2026}
}