端到端模型在长语音识别中的比较
音频与语音处理
2019-11-07 v1 计算与语言
机器学习
声音
摘要
端到端自动语音识别(ASR)模型,包括基于注意力的模型与循环神经网络转导器(RNN-T),已展现出优于传统系统的性能。然而,以往研究主要聚焦于通常仅持续数秒或至多数十秒的短语音。此类架构在持续数分钟至数小时的长语音上是否实用仍是一个开放问题。本文中,我们既研究也改进了端到端模型在长语音转写上的性能。我们首先在实际长语音任务上对不同端到端模型进行实证比较,表明在此情形下RNN-T模型比基于注意力的系统鲁棒得多。接着,我们探索了两种显著提升基于注意力系统性能的改进:限制注意力为单调,以及应用一种将长语音切分为较短重叠片段的新解码算法。结合这两种改进,我们展示了基于注意力的端到端模型在长语音识别上可与RNN-T极具竞争力。
引用
@article{arxiv.1911.02242,
title = {A comparison of end-to-end models for long-form speech recognition},
author = {Chung-Cheng Chiu and Wei Han and Yu Zhang and Ruoming Pang and Sergey Kishchenko and Patrick Nguyen and Arun Narayanan and Hank Liao and Shuyuan Zhang and Anjuli Kannan and Rohit Prabhavalkar and Zhifeng Chen and Tara Sainath and Yonghui Wu},
journal= {arXiv preprint arXiv:1911.02242},
year = {2019}
}
备注
ASRU camera-ready version