一种基于合成数据的端到端ASR系统域适应简单基线方法
音频与语音处理
2022-06-28 v1 机器学习
声音
摘要
自动语音识别(ASR)已由基于深度学习的端到端语音识别模型主导。这些方法需要大量以音频-文本对形式出现的标注数据。此外,与传统模型相比,这些模型更容易受到域偏移的影响。通常的做法是训练通用ASR模型,然后使用相对较小的数据集将其适应到目标域。我们考虑一种更极端的域适应情况,即仅可获得纯文本语料。在这项工作中,我们提出了一种用于端到端语音识别模型域适应的简单基线技术。我们使用单说话人文本转语音(TTS)引擎将纯文本语料转换为音频数据。然后利用目标域中的并行数据对通用ASR模型的最终全连接层进行微调。我们表明,单说话人合成TTS数据配合仅最终全连接层微调可在词错误率上带来合理改进。我们使用来自地址和电商搜索域的文本数据,在CTC和基于注意力的模型上展示了我们低成本基线方法的有效性。
引用
@article{arxiv.2206.13240,
title = {A Simple Baseline for Domain Adaptation in End to End ASR Systems Using Synthetic Data},
author = {Raviraj Joshi and Anupam Singh},
journal= {arXiv preprint arXiv:2206.13240},
year = {2022}
}
备注
Accepted at ECNLP @ACL 2022