MMAC-Copilot:多模态智能体协作操作副驾驶
人工智能
2025-03-25 v3 人机交互
摘要
与PC应用程序交互的大语言模型智能体常常因与现实环境交互模式单一而面临局限性,导致多功能性受限和频繁的幻觉。为解决这一问题,我们提出了多模态智能体协作框架(MMAC-Copilot),该框架利用多种智能体的集体专业知识来增强与应用程序的交互能力。该框架引入了一个团队协作链,使每个参与的智能体能够基于其特定领域知识贡献见解,有效减少与知识领域差距相关的幻觉。我们使用GAIA基准和新引入的视觉交互基准(VIBench)评估了MMAC-Copilot。MMAC-Copilot在GAIA上取得了卓越性能,比现有领先系统平均提升6.8%。VIBench专注于跨多个领域的非API可交互应用程序,包括3D游戏、娱乐和办公场景。它在VIBench上也展示了卓越的能力。我们希望这项工作能启发该领域,并为自主智能体提供更全面的评估。匿名GitHub地址:\href{https://anonymous.4open.science/r/ComputerAgentWithVision-3C12}{Anonymous Github}
引用
@article{arxiv.2404.18074,
title = {MMAC-Copilot: Multi-modal Agent Collaboration Operating Copilot},
author = {Zirui Song and Yaohang Li and Meng Fang and Yanda Li and Zhenhao Chen and Zecheng Shi and Yuan Huang and Xiuying Chen and Ling Chen},
journal= {arXiv preprint arXiv:2404.18074},
year = {2025}
}
备注
Technical Reports