利用内容与声学表征进行语音情感识别
音频与语音处理
2025-08-27 v3
摘要
语音情感识别 (SER) 是从语音内容中识别情感表达的任务,由于难以提取能捕捉情感属性的表征,因而具有挑战性。标注数据集的稀缺性进一步复杂化了这一挑战,其中大型模型容易出现过拟合。在本文中,我们提出了 CARE (Content and Acoustic Representations of Emotions),其中设计了一种双重编码方案,强调语音的语义和声学因素。虽然语义编码器是通过从句子级文本表征进行蒸馏训练的,但声学编码器则被训练以预测语音信号的低层帧级特征。该双重编码方案是一个基于小规模模型,仅在无监督的原始语音上进行训练。通过在下游任务上训练一个简单的轻量级分类模型,我们展示了 CARE 的嵌入在多种数据集上提供了有效的情感识别。我们将与几种其他自监督模型以及最新的大语言模型方法进行比较。在这些评估中,CARE 在 8 个多样化数据集上的平均性能表现最佳。我们还进行了若干消融研究,以分析各种设计选择的重要性。
引用
@article{arxiv.2409.05566,
title = {Leveraging Content and Acoustic Representations for Speech Emotion Recognition},
author = {Soumya Dutta and Sriram Ganapathy},
journal= {arXiv preprint arXiv:2409.05566},
year = {2025}
}
备注
Accepted for publication at IEEE Transactions on Audio, Speech and Language Processing; 11 pages, 6 figures, 6 tables