以文本检索增强语音样本预训练端到端 ASR 模型
音频与语音处理
2023-08-01 v1
摘要
在端到端自动语音识别系统中,语言扩展的困难之一在于配对的语音与文本训练数据有限。本文提出一种新方法,利用未配对的语音特征段与文本数据生成增强样本用于模型预训练,其优势在于无需额外语音数据且成本低。将我们方法生成的 20,000 小时增强语音数据与 12,500 小时原始转写语音数据混合用于意大利语 Transformer transducer 模型预训练时,我们实现了 8.7% 的相对词错误率下降。该预训练模型取得了与使用多语言转写 75,000 小时原始语音数据预训练的模型相近的性能。当将增强语音数据与多语言数据合并预训练新模型时,我们相较基线实现了更进一步的 12.2% 相对词错误率下降,这进一步验证了我们的语音数据增强方法的有效性。
引用
@article{arxiv.2307.16332,
title = {Pre-training End-to-end ASR Models with Augmented Speech Samples Queried by Text},
author = {Eric Sun and Jinyu Li and Jian Xue and Yifan Gong},
journal= {arXiv preprint arXiv:2307.16332},
year = {2023}
}