中文

TinyLVLM-eHub:面向大型视觉语言模型的全面高效评测

计算机视觉与模式识别 2024-08-13 v2 人工智能

摘要

大型视觉语言模型(LVLMs)的最新进展在解决复杂多模态任务方面取得了显著进步。在这些前沿发展中,Google 的 Bard 以其卓越的多模态能力脱颖而出,促进了跨多个领域的综合理解与推理。本工作通过对 LVLMs 多模态能力(尤其聚焦 Bard)的早期整体评测,提出 LVLM-eHub 的轻量变体 Tiny LVLM-eHub。相较于原始版本,Tiny LVLM-eHub 具有若干吸引人的特性。首先,它通过 4242 个标准文本相关视觉基准的定量评测,对六类多模态能力进行系统评估,包括视觉感知、视觉知识获取、视觉推理、视觉常识、物体幻觉与具身智能。其次,它利用 ChatGPT 集成评测(CEE)对 LVLMs 的预测进行深度分析,从而获得鲁棒且准确的评测,并相较词匹配方法表现出与人工评测更好的对齐。第三,它仅包含 2.12.1K 图文对,便于实践者评测其自有离线 LVLMs。通过大量实验分析,本研究表明 Bard 除物体幻觉外的大多数多模态能力均优于以往 LVLMs,而 Bard 仍易受物体幻觉影响。Tiny LVLM-eHub 作为各类 LVLMs 的基线评测,并鼓励旨在推进多模态技术的创新策略。我们的项目公开于 \url{https://github.com/OpenGVLab/Multi-Modality-Arena}。

关键词

引用

@article{arxiv.2308.03729,
  title  = {TinyLVLM-eHub: Towards Comprehensive and Efficient Evaluation for Large Vision-Language Models},
  author = {Wenqi Shao and Meng Lei and Yutao Hu and Peng Gao and Kaipeng Zhang and Fanqing Meng and Peng Xu and Siyuan Huang and Hongsheng Li and Yu Qiao and Ping Luo},
  journal= {arXiv preprint arXiv:2308.03729},
  year   = {2024}
}

备注

accepted to IEEE Transactions on Big Data. Project Page: http://lvlm-ehub.opengvlab.com/