基于多模态建模的艺术作品情感感知理解
计算机视觉与模式识别
2021-10-14 v1 计算与语言
摘要
对人类由艺术引发的情感进行计算建模是一个具有挑战性的问题,因为艺术和情感信号具有主观且细微的性质。在本文中,我们考虑上述利用文本和视觉两种模态理解观众被艺术作品引发的情绪的问题。具体而言,我们将观众表达情感的图像及伴随的文本描述作为多模态分类任务进行分析。我们的结果表明,相较于仅使用图像的模型以及为文本和图像模态设置独立通路的双流多模态模型,MMBT和VisualBERT等单流多模态基于Transformer的模型表现更优。我们还观察到,当单流模型(如MMBT)与仅文本的Transformer模型(如BERT)比较时,极端正向和负向情感类别的性能有所提升。
引用
@article{arxiv.2110.06486,
title = {Understanding of Emotion Perception from Art},
author = {Digbalay Bose and Krishna Somandepalli and Souvik Kundu and Rimita Lahiri and Jonathan Gratch and Shrikanth Narayanan},
journal= {arXiv preprint arXiv:2110.06486},
year = {2021}
}
备注
5 pages, 5 figures. Accepted at ICCV2021: 4th Workshop on Closing the loop between Vision and Language