属性感知的视觉情感表示学习
计算机视觉与模式识别
2025-04-10 v1 人工智能
多媒体
摘要
视觉情感分析或识别因理解图像如何传递丰富语义并在人类感知中唤起情感而受到广泛关注。然而,视觉情感分析在与传统视觉任务的区别在于,一般视觉特征与不同情感状态之间的复杂关系,称为情感鸿沟。研究人员使用深度表示学习方法来解决从整个图像中提取通用特征的挑战。然而,大多数现有方法忽视了特定情感属性的重要性,如亮度、饱和度、场景理解和面部表情。通过本文,我们引入 A4Net,一种深度表示网络,通过利用四个关键属性:亮度(属性 1)、饱和度(属性 2)、场景上下文(属性 3)和面部表情(属性 4)来弥合情感鸿沟。通过融合和联合训练所有属性识别和视觉情感分析的各个方面,A4Net 旨在提供对图像中情感内容的更好见解。实验结果表明 A4Net 的有效性,展示了在多样化视觉情感数据集上与最先进方法的竞争性能。此外,A4Net 生成的激活图可视化提供了其跨数据集泛化能力的见解。
引用
@article{arxiv.2504.06578,
title = {Attributes-aware Visual Emotion Representation Learning},
author = {Rahul Singh Maharjan and Marta Romeo and Angelo Cangelosi},
journal= {arXiv preprint arXiv:2504.06578},
year = {2025}
}
备注
9 pages, 3 figures