中文

探索GPT-4V的视觉文化意识:全面探测

计算与语言 2024-02-16 v2 计算机视觉与模式识别

摘要

预训练的大规模视觉语言模型近年来因其卓越的性能引起了广泛关注。尽管从不同角度评估这些模型付出了大量努力,但最先进的GPT-4V模型在视觉文化意识方面的程度仍未得到探索。为填补这一空白,我们使用MaRVL基准数据集对GPT-4V进行了广泛探测,旨在研究其在视觉理解方面的能力和局限性,重点关注文化方面。具体而言,我们引入了三个视觉相关任务,即字幕分类、成对字幕生成和文化标签选择,以系统地深入进行细粒度视觉文化评估。实验结果表明,GPT-4V在识别文化概念方面表现出色,但在低资源语言(如泰米尔语和斯瓦希里语)上仍表现较弱。值得注意的是,通过人工评估,GPT-4V在图像字幕生成任务中比原始的MaRVL人工标注更具文化相关性,这为未来视觉文化基准构建提供了一种有前景的解决方案。

关键词

引用

@article{arxiv.2402.06015,
  title  = {Exploring Visual Culture Awareness in GPT-4V: A Comprehensive Probing},
  author = {Yong Cao and Wenyan Li and Jiaang Li and Yifei Yuan and Antonia Karamolegkou and Daniel Hershcovich},
  journal= {arXiv preprint arXiv:2402.06015},
  year   = {2024}
}

备注

work in process