OmniBench:通用全模态语言模型的未来
计算与语言
2026-01-01 v6 人工智能
计算机视觉与模式识别
摘要
最近的多模态大语言模型(MLLM)进展旨在整合和解释数据中存在的多种模态。然而,这些模型在同时处理和推理多个模态的能力仍未得到充分探索,这部分原因在于缺乏全面的模态级基准测试。我们引入OmniBench,一个新颖的基准,旨在严格评估模型识别、解释和跨视觉、声学和文本输入进行推理的能力。我们将能够进行三模态处理的语言模型定义为全模态语言模型(OLM)。OmniBench以高质量的人工注释为特征,确保准确的响应需要跨所有三个模态的集成理解和推理。我们的主要发现揭示了:i)开源OLM在三模态上下文中的指令遵循和推理能力存在关键局限;ii)大多数基线模型即使提供了图像或声音的替代文本表示,准确率也表现不佳(低于50%)。这些结果表明,在现有MLLM训练范式中,构建文本、图像和音频一致上下文能力常被忽视。为解决这一问题,我们策划了一个包含84.5K训练样本的指令微调数据集OmniInstruct,用于训练OLM以适应三模态上下文。我们呼吁未来的研究聚焦于开发更稳健的三模态集成技术和训练策略以提升OLM。代码、数据和实时排行榜可在https://m-a-p.ai/OmniBench查阅。
引用
@article{arxiv.2409.15272,
title = {OmniBench: Towards The Future of Universal Omni-Language Models},
author = {Yizhi Li and Yinghao Ma and Ge Zhang and Ruibin Yuan and Kang Zhu and Hangyu Guo and Yiming Liang and Jiaheng Liu and Zekun Wang and Jian Yang and Siwei Wu and Xingwei Qu and Jinjie Shi and Xinyue Zhang and Zhenzhu Yang and Yidan Wen and Yanghai Wang and Shihao Li and Zhaoxiang Zhang and Zachary Liu and Emmanouil Benetos and Wenhao Huang and Chenghua Lin},
journal= {arXiv preprint arXiv:2409.15272},
year = {2026}
}
备注
Accepted by The Thirty-Ninth Annual Conference on Neural Information Processing Systems (NeurIPS2025)