UNO-Bench:探索单模态与全模态模型之间单模态-全模态组合规律的统一基准
计算与语言
2025-10-31 v3 人工智能
摘要
多模态大语言模型正从单模态理解向统一视觉、音频和语言模态的能力发展,合称全模态模型。然而,单模态与全模态之间的相关性尚不清晰,这需要全面的评估来推动全模态模型的智能化发展。本文引入一种新型、高质量且统一的全模态模型基准,UNO-Bench。该基准旨在有效评估单模态和全模态能力,基于统一的能力分类体系,涵盖44种任务类型和5种模态组合。它包括1250个人工精选的全模态样本,实现98%的跨模态可解性;以及2480个增强的单模态样本。人工生成的数据集符合实际场景,尤其在中国语境下,而自动压缩数据集在速度上提升90%,在18个公开基准上保持98%的一致性。除传统多选题外,我们提出一种创新的多步骤开放式问题格式,以评估复杂推理。集成通用评分模型,支持6种问题类型自动评估,准确率达95%。实验结果表明,单模态与全模态性能之间的组成规律成立,全模态能力在弱模型中表现为瓶颈效应,而在强模型中表现为协同增强。
引用
@article{arxiv.2510.18915,
title = {UNO-Bench: A Unified Benchmark for Exploring the Compositional Law Between Uni-modal and Omni-modal in Omni Models},
author = {Chen Chen and ZeYang Hu and Fengjiao Chen and Liya Ma and Jiaxing Liu and Xiaoyu Li and Ziwen Wang and Xuezhi Cao and Xunliang Cai},
journal= {arXiv preprint arXiv:2510.18915},
year = {2025}
}
备注
v3: Switch the paper template. Work in progress. Github: https://github.com/meituan-longcat/UNO-Bench Hugging Face: https://huggingface.co/datasets/meituan-longcat/UNO-Bench