面向语音情感识别与领域适应的参数高效微调
音频与语音处理
2024-04-02 v1 机器学习
声音
摘要
基础模型在语音情感识别(SER)中展现出卓越的性能。然而,鉴于情感语料库中数据的有限性,对大规模预训练模型进行全参数微调进行语音情感识别既会消耗大量资源,又容易产生过拟合。本文针对语音情感识别(SER)的参数高效微调(PEFT)进行了研究。系统研究了 various PEFT 方法在离散情感类别分类和维度化情感属性预测中的应用。结果表明,PEFT 方法的组合在显著降低可训练参数数量的同时,优于全参数微调。此外,本文提出了一种两阶段适应策略,用于将在演示情感数据上训练的模型适配,以更擅长捕捉自然情感表达。 intra- 和 cross-corpus 实验均验证了所提出方法在增强源域和目标域性能方面的有效性。
引用
@article{arxiv.2402.11747,
title = {Parameter Efficient Finetuning for Speech Emotion Recognition and Domain Adaptation},
author = {Nineli Lashkarashvili and Wen Wu and Guangzhi Sun and Philip C. Woodland},
journal= {arXiv preprint arXiv:2402.11747},
year = {2024}
}