基于视觉语言模型的人物艺术品解读:情感与情感符号的案例研究
计算机视觉与模式识别
2025-12-01 v1 计算与语言
摘要
情感是艺术表达的基本方面。由于其抽象性质,艺术品中情感的实现方式呈现出广泛的多样性。这些情感受历史变迁影响,其分析需要艺术史方面的专业知识。本文我们调查哪些情感表达方面可以被当前(2025年)的视觉语言模型(VLMs)检测到。我们提出了一项案例研究,评估了三个VLMs(Llava-Llama和两个Qwen模型),让这些模型就艺术品提出四组难度递增的问题:一般内容、情感内容、情感表达方式以及情感符号,并进行定性专家评估。我们发现,VLMs对图像内容的识别相当出色,常常也能识别出所呈现的情感以及其表达方式。模型在具体图像上表现最佳,但在高度抽象或高度象征性的图像上表现不足。符号的可靠识别仍然根本困难。此外,模型继续表现出已知的LLM弱点,即对相关问题提供不一致的答案。
引用
@article{arxiv.2511.22929,
title = {Artwork Interpretation with Vision Language Models: A Case Study on Emotions and Emotion Symbols},
author = {Sebastian Padó and Kerstin Thomas},
journal= {arXiv preprint arXiv:2511.22929},
year = {2025}
}
备注
Accepted for publication at the IJCNLP-AACL workshop on Multimodal Models for Low-Resource Contexts and Social Impact