基于Transducer的端到端ASR在ESPnet中的研究:架构、辅助损失与解码策略
音频与语音处理
2022-01-17 v1 声音
摘要
在本研究中,我们展示了ESPnet中使用RNN-T损失训练的模型的最新进展。其涉及多种架构的使用,如最近提出的Conformer、具有不同辅助准则的多任务学习,以及多种解码策略,包括我们自己的方案。通过实验和基准测试,我们表明我们提出的系统能在LibriSpeech和AISHELL-1等知名数据集上与其他最先进系统竞争。此外,我们证明这些模型在性能和解码速度方面相对于ESPnet中已实现的其他系统都具有前景,使得为流式任务配备强大系统的可能性得以实现。借助这些补充,我们希望扩展ESPnet工具包对研究界的效用,并为ASR产业提供工具以在现实和生产环境中部署我们的系统。
引用
@article{arxiv.2201.05420,
title = {A Study of Transducer based End-to-End ASR with ESPnet: Architecture, Auxiliary Loss and Decoding Strategies},
author = {Florian Boyer and Yusuke Shinohara and Takaaki Ishii and Hirofumi Inaguma and Shinji Watanabe},
journal= {arXiv preprint arXiv:2201.05420},
year = {2022}
}