基于BPE-Dropout的动态声学单元增强用于低资源端到端语音识别
音频与语音处理
2021-06-08 v1 计算与语言
机器学习
声音
摘要
随着语音助手的快速发展,将面向服务器的自动语音识别(ASR)方案适配至直连设备变得至关重要。研究人员与工业界偏好使用端到端ASR系统处理设备端语音识别任务。这是因为相较于混合系统,端到端系统可在保持更高质量的同时做到资源高效。然而,构建端到端模型需要大量语音数据。与语音助手相关的另一挑战性任务是个性化,主要在于处理词汇表外(OOV)词。本工作中,我们考虑在低资源设置且高OOV率下构建高效的端到端ASR系统,具体体现于Babel土耳其语与Babel格鲁吉亚语任务。为解决上述问题,我们提出一种基于BPE-dropout技术的动态声学单元增强方法。该方法以非确定性方式对语句进行分词,以扩展词符上下文并正则化其分布,从而提升模型对未见词的识别能力。它还减少了对最优子词词表大小搜索的需求。该技术在常规与个性化(面向OOV)语音识别任务中带来稳定提升(相对词错率至少6%、相对F值25%),且不增加额外计算成本。得益于BPE-dropout的使用,我们的单语土耳其语Conformer取得了具竞争力的结果:字符错误率(CER)22.2%、词错误率(WER)38.9%,接近已发表最佳多语系统。
引用
@article{arxiv.2103.07186,
title = {Dynamic Acoustic Unit Augmentation With BPE-Dropout for Low-Resource End-to-End Speech Recognition},
author = {Aleksandr Laptev and Andrei Andrusenko and Ivan Podluzhny and Anton Mitrofanov and Ivan Medennikov and Yuri Matveev},
journal= {arXiv preprint arXiv:2103.07186},
year = {2021}
}
备注
16 pages, 7 figures