LMMs-Eval: 大型多模态模型评估的现实检验
计算与语言
2025-09-19 v2 计算机视觉与模式识别
摘要
大型基础模型的发展 necessitates wide-coverage, low-cost, and zero-contamination benchmarks。虽然持续探索语言模型评估,但针对大型多模态模型(Large Multi-modal Models, LMMs)的全面评估研究仍有限。本文引入LMMS-EVAL,一个统一且标准化的多模态基准框架,包含超过50个任务和10多款模型,以促进透明且可复现的评估。尽管LMMS-EVAL覆盖面全面,我们发现其仍未实现低成本和零污染。为迈近这一评估三元悖论,我们进一步引入LMMS-EVAL LITE,一个强调覆盖面和效率的修剪评估工具包。此外,我们提出Multimodal LIVEBENCH,利用持续更新的新闻和线上论坛评估模型在野外的泛化能力,该方法具有低成本和零污染的评估方式。总之,我们的工作强调了在评估大型多模态模型时考虑评估三元悖论的重要性,并提供了实用解决方案以导航评估大型多模态模型中的权衡取舍,为LMMs的更有效和可靠基准测试铺平了道路。我们开源代码并在GitHub和Hugging Face上维护LIVEBENCH榜单。
引用
@article{arxiv.2407.12772,
title = {LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models},
author = {Kaichen Zhang and Bo Li and Peiyuan Zhang and Fanyi Pu and Joshua Adrian Cahyono and Kairui Hu and Shuai Liu and Yuanhan Zhang and Jingkang Yang and Chunyuan Li and Ziwei Liu},
journal= {arXiv preprint arXiv:2407.12772},
year = {2025}
}
备注
Code ad leaderboard are available at https://github.com/EvolvingLMMs-Lab/lmms-eval and https://huggingface.co/spaces/lmms-lab/LiveBench