UniM:统一的任意到任意交错多模态基准
计算机视觉与模式识别
2026-03-06 v1
摘要
在实际的多模态应用中,系统通常需要理解用户提供的任意组合和交错的多模态输入,同时生成以任意方式交错的多媒体输出。这种能力定义了以统一范式进行理解和生成的任意到任意交错多模态学习目标,这为推动多模态大语言模型(MLLM)的发展带来了新挑战和机遇。为此,本文介绍了UniM基准,首个统一的任意到任意交错多模态数据集。UniM包含3.1万个高质量实例,覆盖30个领域和7种代表性模态:文本、图像、音频、视频、文档、代码和3D,每种模态都需要多种交织的推理和生成能力。我们进一步引入了UniM评估套件,沿三个维度进行评估:语义正确性与生成质量、响应结构完整性以及交错连贯性。此外,我们提出了UniMA,一种配备可追溯推理的智能体式基线模型,能够实现结构化的交错生成。全面实验表明,UniM的难度显著,并突显了该方法面临的关键挑战及其发展方向。项目页面为https://any2any-mllm.github.io/unim。
引用
@article{arxiv.2603.05075,
title = {UniM: A Unified Any-to-Any Interleaved Multimodal Benchmark},
author = {Yanlin Li and Minghui Guo and Kaiwen Zhang and Shize Zhang and Yiran Zhao and Haodong Li and Congyue Zhou and Weijie Zheng and Yushen Yan and Shengqiong Wu and Wei Ji and Lei Cui and Furu Wei and Hao Fei and Mong-Li Lee and Wynne Hsu},
journal= {arXiv preprint arXiv:2603.05075},
year = {2026}
}
备注
70 pages, 63 figures, 30 tables, CVPR