预训练模型表征及其抗噪声鲁棒性在语音情感分析中的研究
音频与语音处理
2023-03-07 v1 计算与语言
机器学习
声音
摘要
预训练模型表征已在语音识别、自然语言处理及其他应用中展现出最先进的性能。诸如 Bidirectional Encoder Representations from Transformers (BERT) 与 Hidden units BERT (HuBERT) 等语音模型已能生成词法与声学表征,以惠及语音识别应用。我们研究了利用预训练模型表征从语音中估计维度情感(如激活度、效价与支配度)的方法。我们观察到,效价可能严重依赖词法表征,而激活度与支配度主要依赖声学信息。本工作中,我们使用预训练模型的多模态融合表征来生成最先进的语音情感估计,并显示出相较于标准声学与词法基线,效价估计的 concordance correlation coefficient (CCC,一致性相关系数) 相对提升分别为 100% 与 30%。最后,我们考察了预训练模型表征在噪声与混响退化下的鲁棒性,注意到词法与声学表征受影响的程度不同。我们发现词法表征比声学表征对失真更具鲁棒性,并证明来自多模态模型的知识蒸馏有助于提升基于声学的模型的噪声鲁棒性。
引用
@article{arxiv.2303.03177,
title = {Pre-trained Model Representations and their Robustness against Noise for Speech Emotion Analysis},
author = {Vikramjit Mitra and Vasudha Kowtha and Hsiang-Yun Sherry Chien and Erdrin Azemi and Carlos Avendano},
journal= {arXiv preprint arXiv:2303.03177},
year = {2023}
}
备注
5 pages, conference