中文

基于迁移学习的德国车内语音事件多模态情感识别研究

计算与语言 2019-09-10 v2 人机交互 音频与语音处理

摘要

人类的情感识别是一个复杂过程,需要考虑多种交互信号,如面部表情、话语的韵律和语义内容。通常,自动情感识别研究(除少数例外)仅限于单一模态。我们描述了一项车内实验,从三种模态进行语音交互的情感识别:语音交互的音频信号、驾驶员面部的视觉信号以及驾驶员话语的人工转录内容。我们使用现成工具进行音频和面部情感检测,并将其与利用其他领域现有资源的文本情感识别神经迁移学习方法进行比较。我们发现迁移学习使基于域外语料库的模型能够表现良好。该方法在 F1 分数上贡献高达 10 个百分点,在喜悦、烦恼和不安三种情感上的微观平均 F1 高达 76%。我们的发现还表明,分析面部和音频的现成工具在没有进一步调整的情况下,尚不能用于车内语音交互的情感检测。

关键词

引用

@article{arxiv.1909.02764,
  title  = {Towards Multimodal Emotion Recognition in German Speech Events in Cars using Transfer Learning},
  author = {Deniz Cevher and Sebastian Zepf and Roman Klinger},
  journal= {arXiv preprint arXiv:1909.02764},
  year   = {2019}
}

备注

12 pages, 2 figures, accepted at KONVENS 2019