中文

深度融合:一种用于音视频情感识别的注意力引导因子化双线性池化

机器学习 2019-01-16 v1 计算机视觉与模式识别 人机交互 机器学习

摘要

自动情感识别(AER)由于情感的抽象概念与多种表达而是一项具有挑战性的任务。尽管对其定义尚无共识,人类情绪状态通常可由听觉与视觉系统感知。受人类这一认知过程启发,在AER中同时利用音频与视觉信息是自然之举。然而,大多数传统融合方法仅建立线性范式,如特征拼接与多系统融合,难以捕捉音频与视频间的复杂关联。本文中,我们引入因子化双线性池化(FBP)来深度整合音频与视频特征。具体而言,通过各自模态中嵌入的注意力机制筛选特征,以获取与情感相关的区域。整个流程可在一个神经网络中完成。在EmotiW2018音视频子挑战的AFEW数据库上验证,所提方法取得了62.48%的准确率,优于当前最优结果。

关键词

引用

@article{arxiv.1901.04889,
  title  = {Deep Fusion: An Attention Guided Factorized Bilinear Pooling for Audio-video Emotion Recognition},
  author = {Yuanyuan Zhang and Zi-Rui Wang and Jun Du},
  journal= {arXiv preprint arXiv:1901.04889},
  year   = {2019}
}