一种用于用户生成视频情感识别的端到端视听注意力网络
计算机视觉与模式识别
2020-03-03 v1 人机交互
多媒体
摘要
用户生成视频中的情感识别在以人为中心的计算中起着重要作用。现有方法主要采用传统的两阶段浅层流程,即提取视觉和/或音频特征并训练分类器。本文中,我们提出基于卷积神经网络(CNNs)以端到端方式识别视频情感。具体而言,我们开发了深度视听注意力网络(VAANet),一种将空间、通道维度和时间注意力集成到视觉 3D CNN 中、并将时间注意力集成到音频 2D CNN 中的新型架构。此外,我们基于极性-情感层次约束设计了特殊的分类损失,即极性一致交叉熵损失,以引导注意力生成。在具有挑战性的 VideoEmotion-8 和 Ekman-6 数据集上进行的大量实验表明,所提出的 VAANet 优于视频情感识别的最先进方法。我们的源代码发布于:https://github.com/maysonma/VAANet。
引用
@article{arxiv.2003.00832,
title = {An End-to-End Visual-Audio Attention Network for Emotion Recognition in User-Generated Videos},
author = {Sicheng Zhao and Yunsheng Ma and Yang Gu and Jufeng Yang and Tengfei Xing and Pengfei Xu and Runbo Hu and Hua Chai and Kurt Keutzer},
journal= {arXiv preprint arXiv:2003.00832},
year = {2020}
}
备注
Accepted by AAAI 2020