基于LLM引导的ASRfew-shot边音合成
声音
2026-05-01 v1
摘要
加音自动语音识别(ASR)常因加音训练数据的稀缺而性能下降。先前工作在低资源环境中探索了加音建模,但现有方法通常需要分钟到小时的标记语音,这在真正稀缺的加音场景中仍可能不实用。我们提出了一个管道,利用少于十个参考utterance适配目标加音说话人,并采用大语言模型(LLM)驱动的音素编辑生成加音条件发音。生成的合成语音用于微调自监督ASR模型。实验表明,在真实加音语音上实现了一致的词错误率(WER)降低,包括跨说话人评估和超低数据情境。匹配率随机音素基线显示,音素空间扰动本身是一种强大的增强形式,而LLM驱动的编辑通过加音条件结构提供了额外的提升。
关键词
引用
@article{arxiv.2604.27273,
title = {Few-Shot Accent Synthesis for ASR with LLM-Guided Phoneme Editing},
author = {Yurii Halychanskyi and Nimet Beyza Bozdag and Mark Hasegawa-Johnson and Dilek Hakkani-Tür and Volodymyr Kindratenko},
journal= {arXiv preprint arXiv:2604.27273},
year = {2026}
}
备注
Submitted to Interspeech 2026