中文

OmniPlay:在全模态游戏博弈上对全模态模型的基准测试

人工智能 2025-09-30 v3

摘要

尽管像 Gemini 和 GPT-4o 这样的通用基础模型展现出了令人印象深刻的多模态能力,但现有的评估未能测试它们在动态、交互式世界中的智能。静态基准缺乏能动性,而交互式基准则存在严重的模态瓶颈,通常忽略了关键的听觉和时间线索。为了弥合这一评估鸿沟,我们引入了 OmniPlay,这是一个诊断基准,不仅旨在评估,更旨在探究智能体模型在全感官频谱上的融合与推理能力。基于模态相互依赖的核心哲学,OmniPlay 包含一套由五个游戏环境组成的测试集,系统地创造了协同与冲突的场景,迫使智能体执行真正的跨模态推理。我们对六个领先的全模态模型进行的全面评估揭示了一个关键的两极分化:它们在高保真记忆任务上表现出超人类性能,但在需要稳健推理和战略规划的挑战中却遭遇系统性失败。我们证明,这种脆弱性源于脆弱的融合机制,该机制在模态冲突下导致性能灾难性下降,并揭示了一个反直觉的“少即是多”悖论,即移除感官信息反而能提高性能。我们的发现表明,迈向稳健 AGI 的道路需要研究重点超越单纯扩展,明确解决协同融合问题。我们的平台可在 https://github.com/fuqingbie/omni-game-benchmark 获取,以供匿名评审。

关键词

引用

@article{arxiv.2508.04361,
  title  = {OmniPlay: Benchmarking Omni-Modal Models on Omni-Modal Game Playing},
  author = {Fuqing Bie and Shiyu Huang and Xijia Tao and Zhiqin Fang and Leyi Pan and Junzhe Chen and Min Ren and Liuyu Xiang and Zhaofeng He},
  journal= {arXiv preprint arXiv:2508.04361},
  year   = {2025}
}