联合训练中融合 ASR 输出用于语音情感识别
音频与语音处理
2022-11-11 v2 计算与语言
多媒体
声音
摘要
除声学信息外,基于语音转录文本的语言特征已被证明在语音情感识别(SER)中是有用的。然而,由于情感标注数据的稀缺以及情感语音识别的困难,在该研究领域中难以获得可靠的语言特征和模型。本文提出将自动语音识别(ASR)输出融合到流水线中,以联合训练 SER。ASR 与 SER 之间的关系研究不足,且目前尚不清楚 ASR 的哪些特征以及如何使 SER 受益。通过考察多种 ASR 输出与融合方法,我们的实验表明,在 ASR-SER 联合训练中,采用分层协同注意力融合方法同时引入 ASR 隐藏层输出与文本输出,对 SER 性能的提升最大。在 IEMOCAP 语料库上,我们的方法取得了 63.4% 的加权准确率,接近于使用真实转录文本相结合的基线结果。此外,我们还给出了 IEMOCAP 上新颖的词错误率分析以及 Wav2vec 2.0 模型的层间差异分析,以更好地理解 ASR 与 SER 之间的关系。
引用
@article{arxiv.2110.15684,
title = {Fusing ASR Outputs in Joint Training for Speech Emotion Recognition},
author = {Yuanchao Li and Peter Bell and Catherine Lai},
journal= {arXiv preprint arXiv:2110.15684},
year = {2022}
}
备注
Accepted for ICASSP 2022