基于图监督的序列转导
计算与语言
2022-04-01 v2 机器学习
声音
音频与语音处理
摘要
循环神经网络转导器(RNN-T)目标函数在构建当今生产环境最佳自动语音识别(ASR)系统中起着主要作用。与连接主义时序分类(CTC)目标函数类似,RNN-T 损失使用特定规则来定义如何生成一组对齐以形成全和训练的格点。然而,这些规则是否最优并确实带来最佳可能的 ASR 结果在很大程度上尚属未知。在本工作中,我们提出一种新的转导器目标函数,将 RNN-T 损失推广为接受标签的图表示,从而提供一个灵活高效的框架来操纵训练格点,例如用于研究不同转移规则、实现不同转导器损失或限制对齐。我们证明,采用类 CTC 格点的基于转导器的 ASR 相比标准 RNN-T 取得了更好的结果,同时还确保了严格单调的对齐,这将有助于更好地优化解码过程。例如,所提出的类 CTC 转导器在 LibriSpeech 的 test-other 条件下相对同等基于 RNN-T 的系统实现了 4.8% 的提升。
引用
@article{arxiv.2111.01272,
title = {Sequence Transduction with Graph-based Supervision},
author = {Niko Moritz and Takaaki Hori and Shinji Watanabe and Jonathan Le Roux},
journal= {arXiv preprint arXiv:2111.01272},
year = {2022}
}
备注
Accepted for publication at IEEE ICASSP 2022