对齐受限的流式循环神经网络转导器
计算与语言
2020-11-20 v1 机器学习
声音
音频与语音处理
摘要
语音界对开发用于自动语音识别(ASR)应用的循环神经网络转导器(RNN-T)模型兴趣日增。RNN-T 以不强制训练文本与音频时间对齐的损失函数训练。因此,采用单向长短期记忆(LSTM)编码器的 RNN-T 模型倾向于等待更长的输入音频跨度,才流式输出已解码的 ASR 词符。本工作中,我们提出对 RNN-T 损失函数的修改,并开发对齐受限 RNN-T(Ar-RNN-T)模型,其利用音频-文本对齐信息引导损失计算。我们在 LibriSpeech 与内部数据集上将所提方法与单调 RNN-T 等已有工作比较。我们表明 Ar-RNN-T 损失提供了在词符发射延迟与词错率(WER)间权衡的精细控制。Ar-RNN-T 模型还改进了下游应用,如 ASR 端点检测,通过保证词符在任意给定延迟范围内发射。此外,Ar-RNN-T 损失允许更大批大小及我们 LSTM 模型架构下 4 倍更高吞吐量,从而在 GPU 上实现更快训练与收敛。
引用
@article{arxiv.2011.03072,
title = {Alignment Restricted Streaming Recurrent Neural Network Transducer},
author = {Jay Mahadeokar and Yuan Shangguan and Duc Le and Gil Keren and Hang Su and Thong Le and Ching-Feng Yeh and Christian Fuegen and Michael L. Seltzer},
journal= {arXiv preprint arXiv:2011.03072},
year = {2020}
}
备注
Accepted for presentation at IEEE Spoken Language Technology Workshop (SLT) 2021