面向Transformer时代的维度化语音情感识别的高效微调
声音
2025-03-07 v1 人工智能
音频与语音处理
摘要
准确的语音情感识别是开发面向人的系统的关键。近期进展包括对大规模预训练变换模型(如Wav2Vec 2.0)进行微调。然而,微调过程需要大量计算资源,包括高内存GPU和显著处理时间。随着对准确情感识别需求的增长,亟需高效微调方法以减轻计算负担。本研究聚焦于维度化情感识别,即预测激活(从冷静到兴奋)和价值(从负面到正面)等属性。我们提出了各种微调技术,包括完整微调、部分变换层微调、混合精度微调、带缓存的部分微调,以及在Wav2Vec 2.0基础模型上进行低秩适配(LoRA)。我们发现,混合精度下的部分微调在保持相当于完整微调的性能方面,训练速度提升了67%。引入中间表示缓存进一步提升了效率,加速88%,可学习参数减少71%。我们建议在混合精度下微调最后三个变换层,以在性能和训练效率之间取得平衡,并添加中间表示缓存以获得最佳速度且几乎不牺牲性能。这些发现降低了语音情感识别系统微调的门槛,使更广泛的研究者和实践者能够获得准确的情感识别。
关键词
引用
@article{arxiv.2503.03756,
title = {Efficient Finetuning for Dimensional Speech Emotion Recognition in the Age of Transformers},
author = {Aneesha Sampath and James Tavernor and Emily Mower Provost},
journal= {arXiv preprint arXiv:2503.03756},
year = {2025}
}
备注
ICASSP 2025-2025 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)