中文

ESPnet-SE:面向语音识别集成的端到端语音增强与分离工具包

音频与语音处理 2021-11-18 v1 声音

摘要

我们提出 ESPnet-SE,其设计目标是在单一框架内快速开发语音增强与语音分离系统,并可选配下游语音识别模块。ESPnet-SE 是一个新项目,它集成了丰富的自动语音识别相关模型、资源与系统,以支持和验证所提出的前端实现(即语音增强与分离)。它能够处理单通道与多通道数据,具备去混响、去噪和源分离等多种功能。我们提供了涵盖数据预处理、特征提取、训练与评估流程的全套方案,适用于广泛的基准数据集。本文描述了该工具包的设计、若干重要功能(尤其是区别于其他开源工具包的语音识别集成功能),以及基于主要基准数据集的实验结果。

关键词

引用

@article{arxiv.2011.03706,
  title  = {ESPnet-se: end-to-end speech enhancement and separation toolkit designed for asr integration},
  author = {Chenda Li and Jing Shi and Wangyou Zhang and Aswin Shanmugam Subramanian and Xuankai Chang and Naoyuki Kamo and Moto Hira and Tomoki Hayashi and Christoph Boeddeker and Zhuo Chen and Shinji Watanabe},
  journal= {arXiv preprint arXiv:2011.03706},
  year   = {2021}
}

备注

Accepted by SLT 2021