EmoVerse:面向可解释视觉情感分析的多层次大规模情感表示数据集
计算机视觉与模式识别
2026-04-21 v2
摘要
视觉情感分析(VEA)旨在弥合视觉内容与人类情感响应之间的情感鸿沟。尽管该领域前景广阔,但由于缺乏开源且可解释的数据集,领域进展仍受限。大多数现有研究为整幅图像分配单个离散情感标签,无法洞察视觉元素如何贡献于情感。在本工作中,我们引入EmoVerse数据集,构建大规模开源数据集,通过多层次、类似知识图谱的标注实现可解释的视觉情感分析。通过将情感分解为背景-属性-主体(Background-Attribute-Subject, B-A-S)三元组,并将每个元素锚定到视觉区域,EmoVerse提供词级和主体级的情感推理能力。数据集包含超过21.9万张图片,进一步包括类别情感状态(Categorical Emotion States, CES)和维度情感空间(Dimensional Emotion Space, DES)双重标注,促进离散与连续情感表示的统一。新近提出的多阶段标注流程在尽可能少的人工 effort 下确保高标注可靠性。最后,我们引入一个可解释模型,将视觉线索映射到DES表示,并提供详细的归因解释。数据集、标注流程与模型共同构成推动可解释高层次情感理解发展的全面基础。
引用
@article{arxiv.2511.12554,
title = {EmoVerse: A MLLMs-Driven Emotion Representation Dataset for Interpretable Visual Emotion Analysis},
author = {Yijie Guo and Dexiang Hong and Weidong Chen and Zihan She and Cheng Ye and Xiaojun Chang and Zhendong Mao},
journal= {arXiv preprint arXiv:2511.12554},
year = {2026}
}
备注
11 pages, 7 figures. This is a preprint version of a paper submitted to CVPR 2026