MM-Vet v2:评估大型多模态模型集成能力的挑战性基准
计算机视觉与模式识别
2024-12-03 v2 人工智能
计算与语言
摘要
MM-Vet 包含面向评估集成能力的开放式视觉语言问题,已成为大型多模态模型评估的热门基准。MM-Vet 评估了六项核心视觉语言(视觉-语言)能力:识别、知识、空间感知、语言生成、OCR 和数学。然而,其问题格式仅限于单张图像-文本对,缺乏真实场景中常见的交错图像和文本序列。为此,本文引入了 MM-Vet v2,包含名为'图像-文本序列理解'的新视觉语言能力,用于评估模型处理视觉-语言序列的能力。同时,我们保持了评估样本的高质量,并进一步扩大了评估集规模。使用 MM-Vet v2 对大型多模态模型进行基准测试后发现,Claude 3.5 Sonnet 以71.8的分数表现最佳,略胜以71.0分居次的 GPT-4o。Among open-weight models,InternVL2-Llama3-76B 以68.4分领先。代码、数据和排行榜可访问于 https://github.com/yuweihao/MM-Vet。
引用
@article{arxiv.2408.00765,
title = {MM-Vet v2: A Challenging Benchmark to Evaluate Large Multimodal Models for Integrated Capabilities},
author = {Weihao Yu and Zhengyuan Yang and Lingfeng Ren and Linjie Li and Jianfeng Wang and Kevin Lin and Chung-Ching Lin and Zicheng Liu and Lijuan Wang and Xinchao Wang},
journal= {arXiv preprint arXiv:2408.00765},
year = {2024}
}
备注
Code, data and leaderboard: https://github.com/yuweihao/MM-Vet