中文

探索基于自监督多视角对比学习的语音情感识别技术,以应对稀缺标注情况

计算与语言 2025-02-25 v1 人工智能 声音 音频与语音处理

摘要

近期深度学习和自监督学习(SSL)的进展导致语音情感识别(SER)性能达到前所未有的水平。然而,获取足够数量的准确标注数据用于训练或微调模型仍是昂贵且具挑战性的任务。在本文中,我们提出了一种可应用于各种语音表示(包括由大型语音模型生成的表示)的多视角SSL预训练技术,以提高稀缺标注情境下的SER性能。我们的实验基于wav2vec 2.0、频谱特征和副语言特征,表明该框架在极端稀疏数据标注情境下可将SER性能提升最高达10%。

关键词

引用

@article{arxiv.2406.07900,
  title  = {Exploring Self-Supervised Multi-view Contrastive Learning for Speech Emotion Recognition with Limited Annotations},
  author = {Bulat Khaertdinov and Pedro Jeuris and Annanda Sousa and Enrique Hortal},
  journal= {arXiv preprint arXiv:2406.07900},
  year   = {2025}
}

备注

Accepted to Interspeech 2024