探索Wav2vec 2.0微调以改进语音情感识别
音频与语音处理
2023-02-22 v3 计算与语言
机器学习
声音
摘要
尽管Wav2Vec 2.0是为语音识别(ASR)提出的,它也可用于语音情感识别(SER);其性能可通过不同的微调策略显著提升。首先给出两种基线方法:朴素微调(V-FT)和任务自适应预训练(TAPT)。我们表明V-FT能够在IEMOCAP数据集上超越最先进模型。TAPT是一种现有的NLP微调策略,进一步提升了SER上的性能。我们还引入了一种称为P-TAPT的新微调方法,其修改TAPT目标以学习上下文化情感表示。实验表明P-TAPT优于TAPT,尤其在低资源设置下。相较于该文献中已有工作,我们的顶级系统在IEMOCAP上以未加权准确率(UA)取得了比最先进性能绝对提升7.4%的结果。我们的代码已公开可用。
引用
@article{arxiv.2110.06309,
title = {Exploring Wav2vec 2.0 fine-tuning for improved speech emotion recognition},
author = {Li-Wei Chen and Alexander Rudnicky},
journal= {arXiv preprint arXiv:2110.06309},
year = {2023}
}
备注
Accepted to ICASSP 2023