中文

多模态大语言模型能否理解中国图像的深层含义?

计算与语言 2024-10-18 v1 人工智能 计算机视觉与模式识别 计算机与社会

摘要

随着多模态大语言模型(MLLMs)能力的不断提升,对其更高阶能力的评估需求日益增长。然而,缺乏针对 MLLM 评估其处理中文视觉内容的高阶感知与理解能力的工作。为填补这一空白,我们引入中华图像隐义理解基准测试(CII-Bench),旨在评估 MLLM 对中文图像的高阶感知与理解能力。CII-Bench 在多个方面区别于现有基准测试。首先,为确保中文语境的真实性,CII-Bench 中的图像来源于中国互联网并经过人工审核,相应答案也由人工精心撰写。此外,CII-Bench 包含代表中国传统文化的图像,如著名中国传统画作,这些图像能够深刻反映模型对中国传统文化理解的深度。通过在 CII-Bench 上对多种 MLLM进行大规模实验,我们得出了几个重要发现。首先,MLLMs 在 CII-Bench 上的表现与人类存在显著差距。最高准确率为 64.4%,而人类准确率平均为 78.2%,最高可达惊人的 81.0%。其次,MLLMs 在中国传统文化图像上的表现较差,表明其在理解高阶语义方面存在局限,缺乏对中国传统文化的深厚知识储备。最后,大多数模型在图像情感线索被纳入提示后表现出增强的准确率。我们相信 CII-Bench 将使 MLLM 能够更好地理解中文语义和中文特定图像,推动其向专家级人工通用智能(AGI)的发展。我们的项目已公开于 https://cii-bench.github.io/。

关键词

引用

@article{arxiv.2410.13854,
  title  = {Can MLLMs Understand the Deep Implication Behind Chinese Images?},
  author = {Chenhao Zhang and Xi Feng and Yuelin Bai and Xinrun Du and Jinchang Hou and Kaixin Deng and Guangzeng Han and Qinrui Li and Bingli Wang and Jiaheng Liu and Xingwei Qu and Yifei Zhang and Qixuan Zhao and Yiming Liang and Ziqiang Liu and Feiteng Fang and Min Yang and Wenhao Huang and Chenghua Lin and Ge Zhang and Shiwen Ni},
  journal= {arXiv preprint arXiv:2410.13854},
  year   = {2024}
}

备注

32 pages,18 figures. Project Page: https://cii-bench.github.io/ Code: https://github.com/MING_X/CII-Bench Dataset: https://huggingface.co/datasets/m-a-p/CII-Bench