中文

由Conformer推动的ESPnet工具包近期进展

音频与语音处理 2020-10-30 v2 声音

摘要

在本研究中,我们介绍ESPnet(端到端语音处理工具包)的近期进展,主要涉及一种近期提出的称为Conformer(卷积增强Transformer)的架构。本文展示了面向广泛端到端语音处理应用的结果,如自动语音识别(ASR)、语音翻译(ST)、语音分离(SS)和文本到语音(TTS)。我们的实验揭示了使用Conformer在不同任务上获得的各种训练技巧和显著性能收益。这些结果具有竞争力甚至优于当前最先进的Transformer模型。我们正准备使用开源及公开可用语料库,为上述所有任务发布带有预训练模型的一体化配方。我们此项工作的目标是通过减轻通常需高资源准备的尖端研究环境负担,来贡献于我们的研究社区。

关键词

引用

@article{arxiv.2010.13956,
  title  = {Recent Developments on ESPnet Toolkit Boosted by Conformer},
  author = {Pengcheng Guo and Florian Boyer and Xuankai Chang and Tomoki Hayashi and Yosuke Higuchi and Hirofumi Inaguma and Naoyuki Kamo and Chenda Li and Daniel Garcia-Romero and Jiatong Shi and Jing Shi and Shinji Watanabe and Kun Wei and Wangyou Zhang and Yuekai Zhang},
  journal= {arXiv preprint arXiv:2010.13956},
  year   = {2020}
}