中文

噪声条件下视听情感识别的研究

声音 2021-03-03 v1 计算与语言 音频与语音处理

摘要

本文探讨噪声声学条件下以语音特征为重点的视听情感识别。我们尝试回答以下研究问题:(i) 语音情感识别在噪声数据上表现如何?以及 (ii) 多模态方法在多大程度上提高准确率并补偿不同噪声水平下潜在的性能退化?我们对两个叠加了不同信噪比噪声的情感数据集进行解析性研究,比较三类声学特征。视觉特征通过混合融合方式并入:首层神经网络为独立的模态专用层,其后在最终预测前至少接一个共享层。结果显示,在干净音频上训练的模型应用于噪声数据时性能显著下降,而添加视觉特征可缓解该效应。

关键词

引用

@article{arxiv.2103.01894,
  title  = {Investigations on Audiovisual Emotion Recognition in Noisy Conditions},
  author = {Michael Neumann and Ngoc Thang Vu},
  journal= {arXiv preprint arXiv:2103.01894},
  year   = {2021}
}

备注

Published at the IEEE workshop on Spoken Language Technology (SLT) 2021