用于语音情感识别的卷积层多阶段语言条件化
机器学习
2023-03-27 v2
摘要
本文中,我们研究了文本与音频特征深度融合对于分类与维度语音情感识别(SER)的有效性。我们提出了一种新颖的多阶段融合方法,在两个信息流于深度神经网络(DNN)的若干层中集成,并与在单点合并流的阶段融合方法对比。两种方法均依赖于从预训练 BERT 模型提取摘要语言嵌入,并对作用于 log-Mel 谱图的卷积模型的一个或多个中间表示进行条件化。在 MSP-Podcast 与 IEMOCAP 数据集上的实验表明,两种融合方法在量化性能与定性行为上均明显优于浅层(晚期)融合基线及其单模态组成。总体而言,我们的多阶段融合展现出更好的量化性能,在大多数评估中超越其他方案。这说明了多阶段融合在更好同化文本与音频信息方面的潜力。
引用
@article{arxiv.2110.06650,
title = {Multistage linguistic conditioning of convolutional layers for speech emotion recognition},
author = {Andreas Triantafyllopoulos and Uwe Reichel and Shuo Liu and Stephan Huber and Florian Eyben and Björn W. Schuller},
journal= {arXiv preprint arXiv:2110.06650},
year = {2023}
}