向多模态通用模型之路:通用层级与通用基准
计算机视觉与模式识别
2025-05-08 v1
摘要
多模态大语言模型(MLLM)正在快速发展,这得益于LLM的高级能力。与早期的专家模型不同,现存的MLLM正向多模态通用范式演进。最初仅限于理解多种模式,这些模型已发展到不仅能理解,还能跨模式生成。其能力从粗粒度的多模态理解扩展到细粒度,从支持有限的模式扩展到任意模式。尽管已有许多基准用于评估MLLM,但一个关键问题随之而来:我们是否可以简单地假设在各种任务上的更好性能即表示更强的MLLM能力,从而逼近人类水平的AI?我们认为答案并非如此简单。本项目引入了General-Level(通用层级),一个定义MLLM性能和通用性的5档等级的评估框架,提供了一种方法来比较MLLM并衡量既有系统在向更稳健的多模态通用体系以及最终向AGI进展的程度。该框架的核心概念是“协同”,用于衡量模型在理解与生成之间以及在多种模式之间是否保持一致的能力。为支持这一评估,我们提出了General-Bench(通用基准),其涵盖更广泛的技能、模式、格式和能力范围,包括超过700个任务和325,800个实例。涉及超过100个最先进MLLM的评估结果揭示了通用体系的能力排名,凸显了达成真正AI能力的挑战。我们期望本项目为未来研究下一代多模态基础模型之路提供动力,为加快实现AGI提供稳健的基础设施。项目页面:https://generalist.top/
引用
@article{arxiv.2505.04620,
title = {On Path to Multimodal Generalist: General-Level and General-Bench},
author = {Hao Fei and Yuan Zhou and Juncheng Li and Xiangtai Li and Qingshan Xu and Bobo Li and Shengqiong Wu and Yaoting Wang and Junbao Zhou and Jiahao Meng and Qingyu Shi and Zhiyuan Zhou and Liangtao Shi and Minghe Gao and Daoan Zhang and Zhiqi Ge and Weiming Wu and Siliang Tang and Kaihang Pan and Yaobo Ye and Haobo Yuan and Tao Zhang and Tianjie Ju and Zixiang Meng and Shilin Xu and Liyu Jia and Wentao Hu and Meng Luo and Jiebo Luo and Tat-Seng Chua and Shuicheng Yan and Hanwang Zhang},
journal= {arXiv preprint arXiv:2505.04620},
year = {2025}
}
备注
ICML'25, 305 pages, 115 tables, 177 figures, project page: https://generalist.top/