用于少样本情感语音识别的预微调
计算与语言
2024-11-08 v3 机器学习
声音
音频与语音处理
摘要
长期以来,人们已知语音模型在许多分类任务上会对特定说话人过拟合。这导致在说话人处于域外或分布外(如生产环境中常见)的场景下泛化性能较差。我们将说话人自适应视为少样本学习问题,并提议研究受近期自然语言任务中预训练模型成功启发而来的迁移学习方法。我们提出在困难任务上对语音模型进行预微调,以将知识提炼至多下游少样本分类目标中。我们在四个多类情感语音识别语料库的每种排列组合上对 Wav2Vec2.0 进行预微调,并通过在 Emotional Speech Dataset 上进行 33,600 次少样本微调试验来评估我们的预微调模型。
引用
@article{arxiv.2302.12921,
title = {Pre-Finetuning for Few-Shot Emotional Speech Recognition},
author = {Maximillian Chen and Zhou Yu},
journal= {arXiv preprint arXiv:2302.12921},
year = {2024}
}
备注
Published at INTERSPEECH 2023. 5 pages, 4 figures. Code available at https://github.com/maxlchen/Speech-PreFinetuning