ESPnet-ST:一体化语音翻译工具包
计算与语言
2020-10-01 v2 声音
音频与语音处理
摘要
我们提出 ESPnet-ST,其设计目标是在单一框架内快速开发语音到语音的翻译系统。ESPnet-ST 是端到端语音处理工具包 ESPnet 内的一个新项目,它集成或新实现了用于语音翻译的自动语音识别、机器翻译与文本到语音功能。我们提供一体化配方,涵盖广泛基准数据集的数据预处理、特征提取、训练与解码流程。我们可复现的结果能够匹配甚至超越当前最先进(SOTA)性能;这些预训练模型可下载。该工具包公开于 https://github.com/espnet/espnet。
引用
@article{arxiv.2004.10234,
title = {ESPnet-ST: All-in-One Speech Translation Toolkit},
author = {Hirofumi Inaguma and Shun Kiyono and Kevin Duh and Shigeki Karita and Nelson Enrique Yalta Soplin and Tomoki Hayashi and Shinji Watanabe},
journal= {arXiv preprint arXiv:2004.10234},
year = {2020}
}
备注
Accepted at ACL 2020 System Demonstration (update Table1, fix typo)