中文

一种用于用户生成视频情感识别的端到端视听注意力网络

计算机视觉与模式识别 2020-03-03 v1 人机交互 多媒体

摘要

用户生成视频中的情感识别在以人为中心的计算中起着重要作用。现有方法主要采用传统的两阶段浅层流程,即提取视觉和/或音频特征并训练分类器。本文中,我们提出基于卷积神经网络(CNNs)以端到端方式识别视频情感。具体而言,我们开发了深度视听注意力网络(VAANet),一种将空间、通道维度和时间注意力集成到视觉 3D CNN 中、并将时间注意力集成到音频 2D CNN 中的新型架构。此外,我们基于极性-情感层次约束设计了特殊的分类损失,即极性一致交叉熵损失,以引导注意力生成。在具有挑战性的 VideoEmotion-8 和 Ekman-6 数据集上进行的大量实验表明,所提出的 VAANet 优于视频情感识别的最先进方法。我们的源代码发布于:https://github.com/maysonma/VAANet。

关键词

引用

@article{arxiv.2003.00832,
  title  = {An End-to-End Visual-Audio Attention Network for Emotion Recognition in User-Generated Videos},
  author = {Sicheng Zhao and Yunsheng Ma and Yang Gu and Jufeng Yang and Tengfei Xing and Pengfei Xu and Runbo Hu and Hua Chai and Kurt Keutzer},
  journal= {arXiv preprint arXiv:2003.00832},
  year   = {2020}
}

备注

Accepted by AAAI 2020