InsightVision:面向大型视觉语言模型评估隐式视觉语义的综合性、多层次中文基准
机器学习
2025-02-25 v1 人工智能
摘要
在多模态语言模型的不断演进背景下,理解通过视觉线索(如讽刺、侮辱或批评)传达的细腻含义,仍是一大挑战。现有评估基准主要聚焦于直接任务(如图像描述生成),或仅限于幽默或讽刺等狭窄类别进行深层语义理解。为填补这一空白,我们首次引入一个综合性、多层次的中文基准,专门用于评估图像中隐式含义的理解。该基准系统性地划分为四个子任务:表层级内容理解、符号意义解读、背景知识理解和隐式含义理解。我们提出了一种创新的半自动数据集构建方法,遵循既定的构建规范。使用该基准,我们评估了15个开源大型视觉语言模型(LVLMs)和GPT-4o,发现即便是表现最佳的模型在理解隐式含义方面仍落后于人类约14%。我们的发现凸显了当前LVLMs在把握细腻视觉语义方面所面临的内在挑战,为该领域的未来研究与发展指明了显著的机遇。我们将公开发布InsightVision数据集及代码。
引用
@article{arxiv.2502.15812,
title = {InsightVision: A Comprehensive, Multi-Level Chinese-based Benchmark for Evaluating Implicit Visual Semantics in Large Vision Language Models},
author = {Xiaofei Yin and Yijie Hong and Ya Guo and Yi Tu and Weiqiang Wang and Gongshen Liu and Huijia zhu},
journal= {arXiv preprint arXiv:2502.15812},
year = {2025}
}
备注
19 pages, 10 figures