用于语音情感识别的对比无监督学习
声音
2021-02-15 v1 机器学习
音频与语音处理
摘要
语音情感识别(SER)是实现更自然人机交流的一项关键技术。然而,SER 长期受限于缺乏公开的大规模标注数据集。为规避此问题,我们研究了对未标注数据集的无监督表示学习如何有益于 SER。我们展示了对比预测编码(CPC)方法能够从无标注数据集中学习显著的表示,从而提升情感识别性能。在我们的实验中,该方法在 IEMOCAP 上针对所有情感基元(激活度、效价和支配度)取得了最先进的 concordance correlation coefficient(CCC,一致性相关系数)性能。此外,在 MSP-Podcast 数据集上,与基线相比我们的方法获得了可观的性能提升。
引用
@article{arxiv.2102.06357,
title = {Contrastive Unsupervised Learning for Speech Emotion Recognition},
author = {Mao Li and Bo Yang and Joshua Levy and Andreas Stolcke and Viktor Rozgic and Spyros Matsoukas and Constantinos Papayiannis and Daniel Bone and Chao Wang},
journal= {arXiv preprint arXiv:2102.06357},
year = {2021}
}