基于深度神经网络的多模态融合用于音视频情感识别
计算机视觉与模式识别
2019-07-09 v1 音频与语音处理
图像与视频处理
摘要
本文提出一种新颖的深度神经网络(DNN),用于音频、视频与文本模态的多模态融合以实现情感识别。所提出的DNN架构具有独立层与共享层,旨在学习各模态的表示,以及为实现最佳预测的最佳组合表示。在AVEC Sentiment Analysis in the Wild数据集上的实验结果表明,所提出的DNN能够达到比其他在特征级(即拼接)进行早期模态融合与在分数级(即加权平均)进行晚期融合的先进系统更高的和谐相关系数(CCC)。所提出的DNN在该数据集的开发集上预测唤醒度、效价与喜好度分别取得了0.606、0.534和0.170的CCC。
引用
@article{arxiv.1907.03196,
title = {Multimodal Fusion with Deep Neural Networks for Audio-Video Emotion Recognition},
author = {Juan D. S. Ortega and Mohammed Senoussaoui and Eric Granger and Marco Pedersoli and Patrick Cardinal and Alessandro L. Koerich},
journal= {arXiv preprint arXiv:1907.03196},
year = {2019}
}