中文

M3ER:利用面部、文本与语音线索的乘性多模态情绪识别

信号处理 2019-11-25 v2 计算与语言 机器学习 音频与语音处理

摘要

我们提出 M3ER,一种基于学习的多输入模态情绪识别方法。我们的方法结合了多个共现模态(如人脸、文本和语音)的线索,并且比其他方法对任意单个模态中的传感器噪声更具鲁棒性。M3ER 建模了一种新颖的、数据驱动的乘性融合方法来组合各模态,其学习在逐样本基础上强调更可靠的线索并抑制其他线索。通过引入一个使用典型相关分析(Canonical Correlational Analysis)来区分无效与有效模态的检查步骤,M3ER 对传感器噪声具有鲁棒性。M3ER 还针对无效模态生成代理特征。我们在两个基准数据集 IEMOCAP 和 CMU-MOSEI 上通过实验证明了我们网络的效率。我们在 IEMOCAP 上报告了 82.7% 的平均准确率,在 CMU-MOSEI 上为 89.0%,总体上比先前工作提高了约 5%。

关键词

引用

@article{arxiv.1911.05659,
  title  = {M3ER: Multiplicative Multimodal Emotion Recognition Using Facial, Textual, and Speech Cues},
  author = {Trisha Mittal and Uttaran Bhattacharya and Rohan Chandra and Aniket Bera and Dinesh Manocha},
  journal= {arXiv preprint arXiv:1911.05659},
  year   = {2019}
}