MM-Vet:面向综合能力的多模态大模型评测
人工智能
2024-12-03 v4 计算与语言
计算机视觉与模式识别
机器学习
摘要
我们提出MM-Vet,一个考察大型多模态模型(LMMs)在复杂多模态任务上表现的评测基准。近期的LMMs已展现出多种引人关注的能力,例如解答黑板上书写的数学题、推理新闻图像中的事件与名人、以及解释视觉笑话。模型的快速进展给评测基准开发带来挑战。问题包括:(1)如何系统性地构建与评估复杂的多模态任务;(2)如何设计跨问答类型均有效的评测指标;(3)如何提供超越简单性能排名的模型洞察。为此,我们推出MM-Vet,其设计基于如下洞见:解决复杂任务的引人关注能力通常源于通用模型能够整合不同的核心视觉-语言(VL)能力。MM-Vet定义了6种核心VL能力,并考察由能力组合导出的16种受关注整合。对于评测指标,我们提出一种基于LLM的开放式输出评测器。该评测器支持跨不同问题类型与回答风格的评估,从而得到统一的评分指标。我们在MM-Vet上评测了具代表性的LMMs,为不同LMM系统范式与模型的能力提供了洞察。
引用
@article{arxiv.2308.02490,
title = {MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities},
author = {Weihao Yu and Zhengyuan Yang and Linjie Li and Jianfeng Wang and Kevin Lin and Zicheng Liu and Xinchao Wang and Lijuan Wang},
journal= {arXiv preprint arXiv:2308.02490},
year = {2024}
}
备注
ICML 2024. Code, data and leaderboard: https://github.com/yuweihao/MM-Vet