中文

大型多模态模型能否揭示图像背后的深层语义?

计算与语言 2024-06-21 v3

摘要

理解图像的深层语义是当前社交媒体主导时代的关键任务。然而,现有研究主要关注图像的表面描述,对内在深层语义的系统性调查存在显著不足。本文引入DEEPEVAL,一个全面的基准,用于评估大型多模态模型(LMM)在视觉深层语义方面的能力。DEEPEVAL包含人工标注的数据集和三个递进子任务:细粒度描述选择、深层标题匹配和深层语义理解。利用DEEPEVAL,我们评估了9个开源LMM和GPT-4V(ision)。我们的评估显示,现有LMM在深层语义理解方面的能力与人类之间存在显著差距。例如,GPT-4V在理解深层语义方面比人类差约30%,尽管其图像描述性能与人类相当。进一步分析表明,LMM在DEEPEVAL上的表现会因所探讨的深层语义具体维度而异,表明在发展LMM方面仍面临根本性挑战。

关键词

引用

@article{arxiv.2402.11281,
  title  = {Can Large Multimodal Models Uncover Deep Semantics Behind Images?},
  author = {Yixin Yang and Zheng Li and Qingxiu Dong and Heming Xia and Zhifang Sui},
  journal= {arXiv preprint arXiv:2402.11281},
  year   = {2024}
}