RNN-T 模型泛化至域外音频的失败:成因与对策
音频与语音处理
2020-12-25 v3 计算与语言
摘要
近年来,全神经端到端方法在若干具有挑战性的自动语音识别(ASR)任务上取得了最先进的结果。然而,大多数现有工作集中于构建训练与测试数据来自同一领域的 ASR 模型。这导致在不匹配领域上泛化特性较差:例如,在短片段上训练的端到端模型在更长语音上评估时表现糟糕。在本工作中,我们分析了流式与非流式循环神经网络转导器(RNN-T)基端到端模型的泛化性质,以识别对泛化性能有负面影响的模型组件。我们提出两种对策:在训练期间组合多种正则化技术,以及使用动态重叠推理。在一个长形式 YouTube 测试集上,当非流式 RNN-T 模型以较短数据片段训练时,所提组合将词错率(WER)从 22.3% 提升至 14.8%;当流式 RNN-T 模型在短 Search 查询上训练时,所提技术将 YouTube 集上的 WER 从 67.0% 提升至 25.3%。最后,当在 Librispeech 上训练时,我们发现动态重叠推理将 YouTube 上的 WER 从 99.8% 提升至 33.0%。
引用
@article{arxiv.2005.03271,
title = {RNN-T Models Fail to Generalize to Out-of-Domain Audio: Causes and Solutions},
author = {Chung-Cheng Chiu and Arun Narayanan and Wei Han and Rohit Prabhavalkar and Yu Zhang and Navdeep Jaitly and Ruoming Pang and Tara N. Sainath and Patrick Nguyen and Liangliang Cao and Yonghui Wu},
journal= {arXiv preprint arXiv:2005.03271},
year = {2020}
}
备注
SLT camera-ready version