中文

ESPnet-ST:一体化语音翻译工具包

计算与语言 2020-10-01 v2 声音 音频与语音处理

摘要

我们提出 ESPnet-ST,其设计目标是在单一框架内快速开发语音到语音的翻译系统。ESPnet-ST 是端到端语音处理工具包 ESPnet 内的一个新项目,它集成或新实现了用于语音翻译的自动语音识别、机器翻译与文本到语音功能。我们提供一体化配方,涵盖广泛基准数据集的数据预处理、特征提取、训练与解码流程。我们可复现的结果能够匹配甚至超越当前最先进(SOTA)性能;这些预训练模型可下载。该工具包公开于 https://github.com/espnet/espnet。

关键词

引用

@article{arxiv.2004.10234,
  title  = {ESPnet-ST: All-in-One Speech Translation Toolkit},
  author = {Hirofumi Inaguma and Shun Kiyono and Kevin Duh and Shigeki Karita and Nelson Enrique Yalta Soplin and Tomoki Hayashi and Shinji Watanabe},
  journal= {arXiv preprint arXiv:2004.10234},
  year   = {2020}
}

备注

Accepted at ACL 2020 System Demonstration (update Table1, fix typo)