基于 Transducer 中统一语音-文本表示的纯文本域自适应
计算与语言
2023-06-08 v1 声音
音频与语音处理
摘要
在端到端(E2E)语音识别中,使用纯文本语料的域自适应具有挑战性。通过 TTS 从文本合成音频进行自适应耗费资源。我们提出一种在 Conformer Transducer(USTR-CT)中学习统一语音-文本表示的方法,以利用纯文本语料实现快速域自适应。与之前的 textogram 方法不同,我们工作中引入了额外的文本编码器来学习文本表示,并在推理时移除,因此在线部署无需修改。为提高自适应效率,还探索了单步和多步自适应。在将 LibriSpeech 自适应到 SPGISpeech 上的实验表明,所提方法在目标域上相对降低了 44% 的词错误率(WER),优于 TTS 方法和 textogram 方法。同时,结果表明所提方法可与内部语言模型估计(ILME)结合以进一步提升性能。
引用
@article{arxiv.2306.04076,
title = {Text-only Domain Adaptation using Unified Speech-Text Representation in Transducer},
author = {Lu Huang and Boyu Li and Jun Zhang and Lu Lu and Zejun Ma},
journal= {arXiv preprint arXiv:2306.04076},
year = {2023}
}
备注
Submitted to Interspeech 2023