刺激感知的视觉情感分析
计算机视觉与模式识别
2021-09-07 v1 人工智能
摘要
视觉情感分析(VEA)近来备受关注,原因在于社交网络上通过图像表达和理解情感的趋势日益增长。与传统视觉任务不同,VEA 本质上更具挑战性,因为它涉及人类认知过程中更高层次的复杂性与模糊性。现有多数方法采用深度学习技术从整幅图像中提取通用特征,忽视了由各类情感刺激所引发的具体特征。受心理学理论中 \textit{刺激-机体-反应(S-O-R)}情感模型的启发,我们提出了一种刺激感知的 VEA 方法,包含三个阶段,即刺激选择(S)、特征提取(O)和情感预测(R)。首先,利用现成工具从图像中选取特定的情感刺激(即颜色、物体、人脸)。据我们所知,这是首次在端到端网络中引入刺激选择过程到 VEA 中。接着,我们设计三个特定网络,即 Global-Net、Semantic-Net 和 Expression-Net,从不同刺激中同时提取不同的情感特征。最后,受益于 Mikel 轮的内在结构,我们设计了一种新颖的分层交叉熵损失,以情感特定的方式区分困难负样本与简单负样本。实验表明,所提方法在四个公开视觉情感数据集上持续优于当前最优方法。消融研究与可视化进一步证明了我们方法的有效性与可解释性。
引用
@article{arxiv.2109.01812,
title = {Stimuli-Aware Visual Emotion Analysis},
author = {Jingyuan Yang and Jie Li and Xiumei Wang and Yuxuan Ding and Xinbo Gao},
journal= {arXiv preprint arXiv:2109.01812},
year = {2021}
}
备注
Accepted by TIP