中文

结合最近邻搜索的监督对比学习用于语音情感识别

音频与语音处理 2023-09-01 v1 声音

摘要

语音情感识别(SER)由于数据有限且某些情感的边界模糊而是一项具有挑战性的任务。本文提出一种贯穿模型生命周期(包括预训练、微调和推理阶段)以提升 SER 性能的综合方法。为解决数据稀缺问题,我们使用了预训练模型 wav2vec2.0。在微调阶段,我们提出一种将交叉熵损失与监督对比学习损失相结合的新颖损失函数,以提升模型的判别能力。该方法增大了类间距离并减小了类内距离,缓解了边界模糊问题。最后,为利用改进后的距离,我们在推理阶段提出一种插值方法,将模型预测与 k 近邻模型的输出相结合。我们在 IEMOCAP 上的实验表明,所提方法优于当前的 SOTA 结果。

关键词

引用

@article{arxiv.2308.16485,
  title  = {Supervised Contrastive Learning with Nearest Neighbor Search for Speech Emotion Recognition},
  author = {Xuechen Wang and Shiwan Zhao and Yong Qin},
  journal= {arXiv preprint arXiv:2308.16485},
  year   = {2023}
}

备注

Accepted by lnterspeech 2023, poster