CVLUE:用于中文视觉语言理解评估的新基准数据集
计算机视觉与模式识别
2024-07-02 v1 计算与语言
摘要
尽管中文视觉语言模型(VLM)发展迅速,但大多数现有中文视觉语言(VL)数据集是基于来自英文VL数据集的西方中心图像构建的。图像中的文化偏见使得这些数据集不适用于评估中文文化中的VL模型。为弥补这一问题,我们提出了一个新的中文视觉语言理解评估(CVLUE)基准数据集,数据集中对象类别和图像的选择完全由中文母语者驱动,确保源图像能代表中文文化。该基准包含四个不同的VL任务,涵盖从图像文本检索到视觉问答、视觉定位和视觉对话。我们对CVLUE进行了详细的统计分析,并在CVLUE及其英文对应数据集上使用几个开源多语言VLM进行基线性能分析,以揭示其在英文和中文之间的性能差距。我们的深入类别级分析揭示了现有VL模型中缺乏中文文化知识。我们还发现,针对与中文文化相关的VL数据集进行微调能有效提升VL模型对中文文化的理解。
引用
@article{arxiv.2407.01081,
title = {CVLUE: A New Benchmark Dataset for Chinese Vision-Language Understanding Evaluation},
author = {Yuxuan Wang and Yijun Liu and Fei Yu and Chen Huang and Kexin Li and Zhiguo Wan and Wanxiang Che},
journal= {arXiv preprint arXiv:2407.01081},
year = {2024}
}