基于音频的情感识别中的自监督学习
声音
2023-07-25 v1 机器学习
音频与语音处理
摘要
使用音频输入数据的情感识别模型能够推动交互式系统的发展,在心理健康护理、营销、游戏和社交媒体分析等领域具有应用价值。尽管基于音频数据的情感计算领域成果丰富,但实现持续高性能模型的主要障碍是可用训练标签的匮乏。自监督学习(SSL)是一类能够通过预测数据自身属性而在监督标签稀缺的情况下进行学习的方法。为理解自监督学习对基于音频的情感识别的效用,我们将自监督学习预训练应用于CMU-MOSEI声学模态的情感分类。与先前在原始声学数据上实验的论文不同,我们的技术应用于编码后的声学数据。我们的模型首先被预训练以揭示声学数据中被随机掩码的时间戳。随后使用少量标注数据对预训练模型进行微调。最终模型的性能通过若干评估指标与具有相同骨干架构的基线深度学习模型进行比较评估。我们发现自监督学习在所有指标上均持续提升模型性能。本工作展示了自监督学习在情感计算中的效用,表明当训练样本数量较少时自监督学习最为有用,且对于快乐、悲伤和愤怒等较易分类的情感效果最为显著。本工作进一步证明,自监督学习在应用于嵌入特征表示时同样有效,而非传统的在原始输入空间上进行预训练的方法。
引用
@article{arxiv.2307.12343,
title = {Self-Supervised Learning for Audio-Based Emotion Recognition},
author = {Peranut Nimitsurachat and Peter Washington},
journal= {arXiv preprint arXiv:2307.12343},
year = {2023}
}
备注
8 pages, 9 figures, submitted to IEEE Transactions on Affective Computing