OmniGAIA:迈向原生全模态AI智能体
人工智能
2026-03-03 v2 计算与语言
计算机视觉与模式识别
机器学习
多媒体
摘要
人类智能自然地将全模态感知——涵盖视觉、音频和语言——与复杂的推理和工具使用交织在一起,以与世界互动。然而,当前的多模态LLM主要局限于双模态交互(例如,视觉-语言),缺乏通用AI助手所需的统一认知能力。为了弥合这一差距,我们引入了OmniGAIA,一个全面的基准测试,旨在评估在视频、音频和图像模态上需要深度推理和多轮工具执行任务的全模态智能体。通过一种新颖的全模态事件图方法构建,OmniGAIA综合了源自真实世界数据的复杂多跳查询,这些查询需要跨模态推理和外部工具集成。此外,我们提出了OmniAtlas,一个在工具集成推理范式下具有主动全模态感知的原生全模态基础智能体。OmniAtlas在通过事后引导的树探索策略和用于细粒度错误纠正的OmniDPO合成的轨迹上进行训练,有效地增强了现有开源模型的工具使用能力。这项工作标志着朝着面向真实世界场景的下一代原生全模态AI助手迈出了一步。
引用
@article{arxiv.2602.22897,
title = {OmniGAIA: Towards Native Omni-Modal AI Agents},
author = {Xiaoxi Li and Wenxiang Jiao and Jiarui Jin and Shijian Wang and Guanting Dong and Jiajie Jin and Hao Wang and Yinuo Wang and Ji-Rong Wen and Yuan Lu and Zhicheng Dou},
journal= {arXiv preprint arXiv:2602.22897},
year = {2026}
}