语音情感:探究模型表征、多任务学习与知识蒸馏
音频与语音处理
2022-07-08 v1 人工智能
计算与语言
机器学习
声音
摘要
从声学语音信号中估计激活度、效价和支配度等维度情感,在过去几年中已被广泛研究。虽然从语音中准确估计激活度和支配度似乎可行,但效价的同等估计仍具挑战性。先前研究表明,使用词汇信息可提升效价估计性能。词汇信息可从预训练声学模型中获取,其中学到的表征能改善从语音进行的效价估计。我们研究了利用预训练模型表征来改进从声学语音信号进行的效价估计。我们还探索了表征融合,以改进跨全部三个情感维度(激活度、效价和支配度)的情感估计。此外,我们探究了预训练模型的表征能否被蒸馏到使用低级特征训练的模型中,从而得到参数量更少的模型。我们表明,与标准声学特征基线(mel-filterbank energies)相比,预训练模型嵌入的融合在效价估计的一致性相关系数(CCC)上带来了79%的相对提升,而从预训练模型嵌入到更低维表征的蒸馏则带来了12%的相对提升。此类性能增益在两个评估集上均被观察到,表明我们所提出的架构在这些评估集上具有泛化能力。我们报告了在两个MSP-Podcast评估集上新的state-of-the-art“无文本”纯声学维度情感估计CCC值。
引用
@article{arxiv.2207.03334,
title = {Speech Emotion: Investigating Model Representations, Multi-Task Learning and Knowledge Distillation},
author = {Vikramjit Mitra and Hsiang-Yun Sherry Chien and Vasudha Kowtha and Joseph Yitan Cheng and Erdrin Azemi},
journal= {arXiv preprint arXiv:2207.03334},
year = {2022}
}
备注
5 pages, 3 figures, Interspeech 2022