大型视觉语言模型是否已经掌握了艺术史?
计算机视觉与模式识别
2025-09-11 v2
摘要
大型视觉语言模型(VLMs)的出现为多个领域的图像分类建立了新的基线。我们考察其多模态推理能力是否也能应对人类专家所掌握的挑战。具体而言,我们测试VLMs能否对绘画的风格、作者和创作日期进行分类,这是传统上由艺术史学家掌握的领域。由于艺术品具有固有的复杂和多样化结构,表现为多变的构图和风格,与自然图像相比,它们构成了独特的挑战。这需要基于语境和风格的解读,而非直接的物体识别。艺术史学家长期以来一直研究艺术品的独特之处,其中风格预测是其学科的关键组成部分。本文研究了整合视觉与文本数据的大型VLMs能否有效地对绘画的历史和风格属性进行推理。我们提出了首个此类研究,对三种VLMs(即CLIP、LLaVA和GPT-4o)进行了深入分析,评估了它们在艺术风格、作者和时期的零样本分类能力。利用两个艺术品图像基准,我们评估了模型解读风格的能力、对提示的敏感性,并检查了失败案例。此外,我们通过分析误分类来关注这些模型与人类艺术史专业知识的对比,从而为它们的推理和分类模式提供了见解。
引用
@article{arxiv.2409.03521,
title = {Have Large Vision-Language Models Mastered Art History?},
author = {Ombretta Strafforello and Derya Soydaner and Michiel Willems and Anne-Sofie Maerten and Stefanie De Winter},
journal= {arXiv preprint arXiv:2409.03521},
year = {2025}
}