中文

面向紧急呼叫中心语料库多模态情感识别的注意力机制探索

计算与语言 2023-06-13 v1 声音 音频与语音处理

摘要

用于增强人类决策的情感检测技术对真实世界应用而言是重要研究课题,但真实生活中的情感数据集相对稀少且规模小。本文实验使用了在法国紧急呼叫中心收集的 CEMO 语料库。两个基于语音和文本的预训练模型被微调用于语音情感识别。使用预训练的 Transformer 编码器缓解了我们的数据有限且稀疏的特性。本文探索了这些模态特定模型的不同融合策略。特别地,测试了带与不带交叉注意力机制的融合,以从语音和文本编码器中收集最相关信息。我们表明,多模态融合相对于任一单模态带来了 4-9% 的绝对增益,且对称多头交叉注意力机制表现优于晚期经典融合方法。我们的实验还表明,对于真实生活的 CEMO 语料库,音频成分比文本成分编码了更多的情感信息。

关键词

引用

@article{arxiv.2306.07115,
  title  = {Exploring Attention Mechanisms for Multimodal Emotion Recognition in an Emergency Call Center Corpus},
  author = {Théo Deschamps-Berger and Lori Lamel and Laurence Devillers},
  journal= {arXiv preprint arXiv:2306.07115},
  year   = {2023}
}

备注

5 pages, 2 figures, 4 tables