基于LLM生成的可控合成语音进行功能性微调的 personalized 语音识别
声音
2025-05-20 v1 音频与语音处理
摘要
本文提出了我们对Speech Accessibility Project挑战的提交方案,用于功能性微调以适应囊疾性语音识别。我们将参数高效微调与潜在音频表示相结合,以改进基于编码器-解码器的语音识别系统。通过对Parler-TTS进行功能性微调,使用LLM生成的提示生成与语料库一致的目标文本,合成能够模拟囊疾性语音的训练数据。个性化微调的x向量在非个性化功能性微调之上持续降低词错误率(WER)。AdaLoRA适配器相较于完整功能性微调和标准低秩适配,分别实现约23%和22%的相对WER降低。进一步的改进(约5%的WER降低)来自纳入基于wav2vec 2.0的音频表示。使用合成囊疾性语音进行训练,可相对于仅进行个性化微调实现最高约7%的相对WER提升。
引用
@article{arxiv.2505.12991,
title = {Personalized Fine-Tuning with Controllable Synthetic Speech from LLM-Generated Transcripts for Dysarthric Speech Recognition},
author = {Dominik Wagner and Ilja Baumann and Natalie Engert and Seanie Lee and Elmar Nöth and Korbinian Riedhammer and Tobias Bocklet},
journal= {arXiv preprint arXiv:2505.12991},
year = {2025}
}
备注
Accepted at Interspeech 2025