2020年ESPnet更新:新特性、应用拓展、性能提升与未来规划
音频与语音处理
2020-12-25 v1 声音
摘要
本文介绍了端到端语音处理工具包ESPnet(https://github.com/espnet/espnet)的最近发展。该项目于2017年12月启动,主要基于序列到序列建模进行端到端语音识别实验。项目发展迅速,现已涵盖广泛的语音处理应用。目前ESPnet还包括文本到语音(TTS)、语音转换(VC)、语音翻译(ST)和语音增强(SE),并支持波束成形、语音分离、去噪与去混响。得益于通用的序列到序列建模特性,所有应用均以端到端方式训练,并可进一步集成与联合优化。此外,通过引入transformer、先进数据增强与conformer,ESPnet为这些应用提供了可复现的一站式方案,并在多个基准上取得最先进(SOTA)性能。本项目旨在为社区提供最新的语音处理体验,使学术界与各类工业界规模的研究人员能够协作开发其技术。
引用
@article{arxiv.2012.13006,
title = {The 2020 ESPnet update: new features, broadened applications, performance improvements, and future plans},
author = {Shinji Watanabe and Florian Boyer and Xuankai Chang and Pengcheng Guo and Tomoki Hayashi and Yosuke Higuchi and Takaaki Hori and Wen-Chin Huang and Hirofumi Inaguma and Naoyuki Kamo and Shigeki Karita and Chenda Li and Jing Shi and Aswin Shanmugam Subramanian and Wangyou Zhang},
journal= {arXiv preprint arXiv:2012.13006},
year = {2020}
}