中文

基于深度神经网络的多模态融合用于音视频情感识别

计算机视觉与模式识别 2019-07-09 v1 音频与语音处理 图像与视频处理

摘要

本文提出一种新颖的深度神经网络(DNN),用于音频、视频与文本模态的多模态融合以实现情感识别。所提出的DNN架构具有独立层与共享层,旨在学习各模态的表示,以及为实现最佳预测的最佳组合表示。在AVEC Sentiment Analysis in the Wild数据集上的实验结果表明,所提出的DNN能够达到比其他在特征级(即拼接)进行早期模态融合与在分数级(即加权平均)进行晚期融合的先进系统更高的和谐相关系数(CCC)。所提出的DNN在该数据集的开发集上预测唤醒度、效价与喜好度分别取得了0.606、0.534和0.170的CCC。

关键词

引用

@article{arxiv.1907.03196,
  title  = {Multimodal Fusion with Deep Neural Networks for Audio-Video Emotion Recognition},
  author = {Juan D. S. Ortega and Mohammed Senoussaoui and Eric Granger and Marco Pedersoli and Patrick Cardinal and Alessandro L. Koerich},
  journal= {arXiv preprint arXiv:1907.03196},
  year   = {2019}
}