中文

用于音视频情感识别的多模态残差感知机网络

信号处理 2021-08-02 v2 人工智能 声音 音频与语音处理 图像与视频处理

摘要

音视频情感识别目前正受到深度神经网络建模工具的攻坚。在已发表的论文中,作者通常仅展示多模态相对于仅音频或仅视频模态的优越性案例。然而,也存在单模态更优的情况。在我们的研究中,我们假设对于模糊类别的情感事件,间接表征于建模神经网络参数中的模态内与模态间噪声信息,阻碍了现有后期融合与端到端多模态网络训练策略取得更好性能。为利用并克服两类方案的缺陷,我们定义了多模态残差感知机网络,其从多模态网络分支执行端到端学习,更好地泛化多模态特征表示。对于所提多模态残差感知机网络及面向流媒体数字电影的新颖时间增强,在 The Ryerson Audio-Visual Database of Emotional Speech and Song 数据集上最先进平均识别率提升至 91.4%,在 Crowd-sourced Emotional multi-modal Actors 数据集上提升至 83.15%。此外,多模态残差感知机网络概念展现出其在处理不仅光学的而且声学类型信号源的多模态应用中的潜力。

关键词

引用

@article{arxiv.2107.10742,
  title  = {Multi-modal Residual Perceptron Network for Audio-Video Emotion Recognition},
  author = {Xin Chang and Władysław Skarbek},
  journal= {arXiv preprint arXiv:2107.10742},
  year   = {2021}
}