中文

基于LLM的文本与音素重写数据合成用于ASR领域适应

音频与语音处理 2026-03-19 v1 声音

摘要

端到端自动语音识别常因领域特定数据稀缺而在目标域 degrades。我们提出一种基于合成数据的数据域适应框架,包含两个贡献:(1)一个大语言模型(LLM)-based文本增强管道,包含平衡词汇多样性、perplexity 及领域术语覆盖的过滤策略;(2)音素重写增强(PRA),一种新方法通过LLM生成的正字法伪拼写引入发音变异性。不同于SpecAugment等声学层方法,PRA 在语音合成前提供音素层面的多样性,使合成语音更贴近真实世界的变异性。跨四个领域特定数据集的实验结果显示,一致降低了词错误率,证明在结合领域特定词汇覆盖与真实发音变异性后,ASR的鲁棒性显著提升。

关键词

引用

@article{arxiv.2603.16920,
  title  = {Synthetic Data Domain Adaptation for ASR via LLM-based Text and Phonetic Respelling Augmentation},
  author = {Natsuo Yamashita and Koichi Nagatsuka and Hiroaki Kokubo and Kota Dohi and Tuan Vu Ho},
  journal= {arXiv preprint arXiv:2603.16920},
  year   = {2026}
}

备注

accepted by ICASSP 2026