中文

自动语音识别的转写零样本域适应

音频与语音处理 2024-12-17 v1 计算与语言 声音

摘要

自动语音识别模型在训练数据未覆盖的域上性能常常退化。域适应可以解决此问题,前提是目标域数据在目标语言中可用。然而,这一假设在许多实际应用中并不成立。为使域适应更具适用性,我们研究了零样本域适应(ZSDA)问题,即目标域数据在目标语言中不可用。相反,我们从另一种源语言转移目标域知识,在该语言中目标域数据更易获取。为此,我们首先进行跨语言预训练(XLPT)以在语言间共享域知识,然后使用目标语言微调来构建最终模型。此实践中的一个挑战是,预训练知识可能在微调过程中被遗忘,导致次优的适应性能。为解决此问题,我们提出了转写ZSDA,以实现一致的预训练和微调标签,从而最大程度地保留预训练知识。实验结果表明,与wav2vec 2.0基线相比,转写ZSDA相对降低了9.2%的词错误率。此外,转写ZSDA始终优于自监督ZSDA,并与监督ZSDA表现相当,证明了基于转写的预训练标签的优越性。

关键词

引用

@article{arxiv.2412.11185,
  title  = {Transliterated Zero-Shot Domain Adaptation for Automatic Speech Recognition},
  author = {Han Zhu and Gaofeng Cheng and Qingwei Zhao and Pengyuan Zhang},
  journal= {arXiv preprint arXiv:2412.11185},
  year   = {2024}
}