LVLM-eHub:面向大型视觉语言模型的综合评测基准
计算机视觉与模式识别
2023-06-16 v1 人工智能
摘要
大型视觉语言模型(LVLMs)近期在多模态视觉语言学习中占据主导地位。尽管取得巨大成功,仍缺乏对其效能的整体评估。本文通过构建LVLM评估中心(LVLM-eHub)对公开可用的多模态大模型进行综合评测。我们的LVLM-eHub包含InstructBLIP和MiniGPT-4等8个代表性LVLM,并通过定量能力评测和在线竞技场平台对其进行彻底评估。前者在47个标准文本相关视觉基准上评估LVLM的6类多模态能力(如视觉问答和具身人工智能),后者提供开放世界问答场景下用户层面的LVLM评估。研究揭示了若干创新性发现。首先,使用大量领域内数据指令微调的LVLM(如InstructBLIP)严重过拟合许多现有任务,在开放世界场景中泛化能力差。其次,使用适量指令跟随数据指令微调的LVLM可能产生物体幻觉问题(即在描述中生成与目标图像不一致的物体)。这使得当前图像字幕的CIDEr等评测指标失效或生成错误答案。第三,采用多轮推理评估框架可缓解物体幻觉问题,为开发有效的LVLM评估流程提供启示。这些发现为构想和评估旨在增强零样本多模态技术的创新策略提供了基础框架。我们的LVLM-eHub将发布于 https://github.com/OpenGVLab/Multi-Modality-Arena
引用
@article{arxiv.2306.09265,
title = {LVLM-eHub: A Comprehensive Evaluation Benchmark for Large Vision-Language Models},
author = {Peng Xu and Wenqi Shao and Kaipeng Zhang and Peng Gao and Shuo Liu and Meng Lei and Fanqing Meng and Siyuan Huang and Yu Qiao and Ping Luo},
journal= {arXiv preprint arXiv:2306.09265},
year = {2023}
}
备注
28 pages, 10 figures, a comprehensive evaluation of large vision-language models