中文

MDAN:用于视觉情感分析的多层级依赖注意力网络

计算机视觉与模式识别 2022-03-28 v1

摘要

视觉情感分析(VEA)正受到越来越多的关注。VEA 最大的挑战之一是弥合图像中视觉线索与图像所表达情感之间的情感鸿沟。随着情感粒度的增加,情感鸿沟也随之增大。现有的深度方法试图通过一次性全局直接学习情感间判别性来弥合这一鸿沟,而未考虑不同情感层级上情感之间的层次关系以及待分类情感的情感层级。本文提出具有两个分支的多层级依赖注意力网络(MDAN),以利用情感层次以及不同情感层级与语义层级之间的相关性。自底向上分支直接在最高情感层级学习情感,并在预测较低情感层级时严格遵循情感层次。相反,自顶向下分支试图通过语义层级与情感层级之间的一对一映射(即情感语义映射)来解耦情感鸿沟。在每个语义层级,一个局部分类器学习对应情感层级上情感间的判别性。最后,我们将全局学习与局部学习整合到一个统一的深度框架中并同时优化网络。此外,为在解耦情感鸿沟时恰当提取并利用通道依赖与空间注意力,我们精心设计了两个注意力模块:多头跨通道注意力模块与层级相关类激活图模块。最终,所提深度框架在六个 VEA 基准上取得了新的 SOTA 性能,大幅超越现有 SOTA 方法,例如在 WEBEmo 数据集 25 类分类准确率上提升 +3.85%。

关键词

引用

@article{arxiv.2203.13443,
  title  = {MDAN: Multi-level Dependent Attention Network for Visual Emotion Analysis},
  author = {Liwen Xu and Zhengtao Wang and Bin Wu and Simon Lui},
  journal= {arXiv preprint arXiv:2203.13443},
  year   = {2022}
}

备注

Published in CVPR 2022