基于迁移学习的多模态情绪检测
音频与语音处理
2020-11-16 v1 计算与语言
人机交互
机器学习
摘要
语音中的自动情绪检测是一项具有挑战性的任务,因为词语与其说话方式之间存在复杂的相互依赖关系。可用数据集使该任务更加困难:其规模小且标注习惯互不相容,难以构建可泛化的情绪检测系统。为应对这两大挑战,我们提出一种多模态方法,首先将从语音与文本中相关任务迁移学习得到的鲁棒神经嵌入,然后用这些嵌入训练一个能够适应此前未见情绪与领域的 pLDA 分类器。我们首先在说话人识别任务上用 VoxCeleb 语料库训练一个多层 TDNN,随后在 Crema-D 语料库的情绪识别任务上对其进行微调。利用该网络,我们从每一层提取 Crema-D 的语音嵌入,使用微调的 BERT 模型为相应转录文本生成并拼接文本嵌入,然后在所得稠密表示上训练一个 LDA–pLDA 分类器。我们详尽评估了各组件的预测能力:单独的 TDNN、单独各层语音嵌入、单独文本嵌入以及它们的每种组合。我们的最佳变体仅用 VoxCeleb 与 Crema-D 训练并在 IEMOCAP 上评估,取得了 38.05% 的 EER。在训练中包含部分 IEMOCAP 则产生 5 折平均 EER 为 25.72%(作为比较,44.71% 的黄金标签标注至少包含一名持异议的标注者)。
引用
@article{arxiv.2011.07065,
title = {Multi-Modal Emotion Detection with Transfer Learning},
author = {Amith Ananthram and Kailash Karthik Saravanakumar and Jessica Huynh and Homayoon Beigi},
journal= {arXiv preprint arXiv:2011.07065},
year = {2020}
}
备注
11 pages, 7 tables, 2 figures