中文

基于深度混合网络的野外音视频情绪识别

计算机视觉与模式识别 2020-02-24 v1

摘要

本文提出一种基于音视频的情绪识别混合网络。尽管以往大多数工作侧重于使用深度模型或从图像中提取的手工设计特征,我们探索了构建在图像与音频信号上的多种深度模型。具体而言,除了在人脸图像上训练的卷积神经网络(CNN)和循环神经网络(RNN)外,该混合网络还包含一个在整体声学特征向量上训练的支持向量机(SVM)分类器、一个在从分段音频片段提取的短期特征序列上训练的长短期记忆网络(LSTM),以及一个在类图像映射(基于短期声学特征序列构建)上训练的 Inception(v2)-LSTM 网络。实验结果表明,所提出的混合网络大幅优于基线方法。

关键词

引用

@article{arxiv.2002.09023,
  title  = {Audio-video Emotion Recognition in the Wild using Deep Hybrid Networks},
  author = {Xin Guo and Luisa F. Polanía and Kenneth E. Barner},
  journal= {arXiv preprint arXiv:2002.09023},
  year   = {2020}
}