用于 RNN-T 个性化的深度浅融合方法
计算与语言
2020-11-17 v1 音频与语音处理
摘要
端到端模型,特别是循环神经网络转导器(RNN-T),由于其在通用转写任务上的简洁性、紧凑性以及优异性能,在过去几年中在自动语音识别领域获得了显著关注。然而,由于缺乏外部语言模型以及难以识别稀有长尾词(特别是实体名称),这些模型相比传统混合系统更难个性化。在这项工作中,我们提出了新技术以改进 RNN-T 对稀有 WordPiece 的建模能力、向编码器注入额外信息、启用替代字形发音,并与个性化语言模型进行深度融合以实现更鲁棒的偏置。我们表明,与使用了浅融合和文本转语音增强的强 RNN-T 基线相比,这些组合技术带来了 15.4%–34.5% 的相对词错率提升。我们的工作有助于推进 RNN-T 个性化的边界,并在偏置和实体识别至关重要的应用场景中缩小与混合系统的差距。
引用
@article{arxiv.2011.07754,
title = {Deep Shallow Fusion for RNN-T Personalization},
author = {Duc Le and Gil Keren and Julian Chan and Jay Mahadeokar and Christian Fuegen and Michael L. Seltzer},
journal= {arXiv preprint arXiv:2011.07754},
year = {2020}
}
备注
To appear at SLT 2021