利用深度学习最新进展进行音视频情感识别
计算机视觉与模式识别
2021-09-15 v2 机器学习
声音
音频与语音处理
摘要
情绪表达是向他人传达我们情绪状态或态度的行为。它们通过言语和非言语交流表达。复杂的人类行为可通过研究多模态(主要为面部、声音和肢体姿态)的物理特征来理解。近来,自发多模态情感识别已广泛用于人类行为分析。本文中,我们提出一种基于深度学习的新方法用于音视频情感识别。我们的方法利用了知识蒸馏和高性能深度架构等深度学习最新进展。音频和视觉模态的深度特征表示基于模型级融合策略进行融合。然后使用循环神经网络捕获时间动态。我们提出的方法在RECOLA数据集上预测效价方面大幅优于最先进方法。此外,我们提出的视觉面部表情特征提取网络在AffectNet和Google Facial Expression Comparison数据集上优于最先进结果。
引用
@article{arxiv.2103.09154,
title = {Leveraging Recent Advances in Deep Learning for Audio-Visual Emotion Recognition},
author = {Liam Schoneveld and Alice Othmani and Hazem Abdelkawy},
journal= {arXiv preprint arXiv:2103.09154},
year = {2021}
}
备注
8 pages, 3 figures, Pattern Recognition Letters