中文

探索Wav2vec 2.0微调以改进语音情感识别

音频与语音处理 2023-02-22 v3 计算与语言 机器学习 声音

摘要

尽管Wav2Vec 2.0是为语音识别(ASR)提出的,它也可用于语音情感识别(SER);其性能可通过不同的微调策略显著提升。首先给出两种基线方法:朴素微调(V-FT)和任务自适应预训练(TAPT)。我们表明V-FT能够在IEMOCAP数据集上超越最先进模型。TAPT是一种现有的NLP微调策略,进一步提升了SER上的性能。我们还引入了一种称为P-TAPT的新微调方法,其修改TAPT目标以学习上下文化情感表示。实验表明P-TAPT优于TAPT,尤其在低资源设置下。相较于该文献中已有工作,我们的顶级系统在IEMOCAP上以未加权准确率(UA)取得了比最先进性能绝对提升7.4%的结果。我们的代码已公开可用。

关键词

引用

@article{arxiv.2110.06309,
  title  = {Exploring Wav2vec 2.0 fine-tuning for improved speech emotion recognition},
  author = {Li-Wei Chen and Alexander Rudnicky},
  journal= {arXiv preprint arXiv:2110.06309},
  year   = {2023}
}

备注

Accepted to ICASSP 2023