MME-Survey:多模态大语言模型评估综述
计算机视觉与模式识别
2024-12-10 v2 人工智能
计算与语言
摘要
作为人工通用智能(AGI)的一个重要方向,多模态大语言模型(MLLMs)已在产业和学术界引起广泛关注。基于预训练的LLMs,这一系列模型进一步发展出令人印象深刻的多模态感知和推理能力,如根据流程图编写代码或基于图像创作故事。在模型开发过程中,评估至关重要,因为它提供了直观的反馈和指导以改进模型。与仅支持单一任务(如图像分类)的传统train-eval-test范式不同,MLLMs的灵活性催生了各种新基准和评估方法。本文旨在提供MLLMs评估的综合综述,讨论四个关键方面:1) 按评估能力归类的基准类型概述,包括基础能力、模型自分析和扩展应用;2) 基准构建的典型过程,包括数据收集、标注和注意事项;3) 由评判者、指标和工具组成的系统评估方式;4) 下一代基准的展望。本工作旨�为研究人员提供有效评估MLLMs的便捷方式,以激发更好的评估方法,从而推动MLLMs研究的进步。
引用
@article{arxiv.2411.15296,
title = {MME-Survey: A Comprehensive Survey on Evaluation of Multimodal LLMs},
author = {Chaoyou Fu and Yi-Fan Zhang and Shukang Yin and Bo Li and Xinyu Fang and Sirui Zhao and Haodong Duan and Xing Sun and Ziwei Liu and Liang Wang and Caifeng Shan and Ran He},
journal= {arXiv preprint arXiv:2411.15296},
year = {2024}
}
备注
Produced by MME+MMBench+LLaVA Teams. Project Page: https://github.com/BradyFU/Awesome-Multimodal-Large-Language-Models/tree/Benchmarks