中文

端到端语音情感识别:真实应急呼叫中心录音数据的挑战

人工智能 2021-10-29 v1 计算与语言 声音 音频与语音处理 机器学习

摘要

从语音中识别说话者的情感可以是应急呼叫中心的关键要素。用于语音情感识别的端到端深度学习系统现在取得了与传统机器学习方法相当甚至更好的结果。在本文中,为了验证我们用于语音情感识别的神经网络架构的性能,我们首先在学界广泛使用的语料库IEMOCAP上训练和测试它。然后,我们将相同的架构用于真实语料库CEMO,该语料库由来自485名说话者的440段对话(2小时16分钟)组成。在这些真实应急对话中,呼叫者表达的最频繁情感是恐惧、愤怒以及如释然等积极情感。在IEMOCAP的一般话题对话中,最频繁的情感是悲伤、愤怒和快乐。使用相同的端到端深度学习架构,在IEMOCAP上获得63%的非加权准确率召回率(UA),在CEMO上获得45.6%的UA,每个均为4类。仅使用2类(愤怒、中性),CEMO的结果为76.9% UA,而IEMOCAP为81.1% UA。我们期望这些在CEMO上令人鼓舞的结果可通过将音频通道与语言通道结合而得到改进。真实生活中的情感显然比表演的情感更复杂,主要是由于说话者情感表达的巨大多样性。索引词—情感检测,端到端深度学习架构,呼叫中心,真实生活数据库,复杂情感。

关键词

引用

@article{arxiv.2110.14957,
  title  = {End-to-End Speech Emotion Recognition: Challenges of Real-Life Emergency Call Centers Data Recordings},
  author = {Théo Deschamps-Berger and Lori Lamel and Laurence Devillers},
  journal= {arXiv preprint arXiv:2110.14957},
  year   = {2021}
}