中文

ESPnet-SE++:面向鲁棒语音识别、翻译与理解的语音增强

音频与语音处理 2022-07-21 v1 计算与语言 机器学习 声音

摘要

本文介绍了将语音分离与增强(SSE)集成到 ESPnet 工具包中的最新进展。与之前的 ESPnet-SE 工作相比,新增了众多特性,包括近期最先进的语音增强模型及其各自的训练与评估方案。重要的是,设计了一个新的接口,以灵活地将语音增强前端与其他任务结合,包括自动语音识别(ASR)、语音翻译(ST)和口语理解(SLU)。为展示此类集成,我们在精心设计的用于含噪混响多通道 ST 与 SLU 任务的合成数据集上进行了实验,这些数据集可用作未来研究的基准语料。除这些新任务外,我们还使用 CHiME-4 和 WSJ0-2Mix 对多通道与单通道 SE 方法进行了基准测试。结果表明,SE 前端与后端任务的集成是一个有前景的研究方向,即便对于 ASR 之外的任务亦然,尤其在多通道场景下。代码已在线发布于 https://github.com/ESPnet/ESPnet。作为本工作另一贡献的多通道 ST 与 SLU 数据集发布于 HuggingFace。

关键词

引用

@article{arxiv.2207.09514,
  title  = {ESPnet-SE++: Speech Enhancement for Robust Speech Recognition, Translation, and Understanding},
  author = {Yen-Ju Lu and Xuankai Chang and Chenda Li and Wangyou Zhang and Samuele Cornell and Zhaoheng Ni and Yoshiki Masuyama and Brian Yan and Robin Scheibler and Zhong-Qiu Wang and Yu Tsao and Yanmin Qian and Shinji Watanabe},
  journal= {arXiv preprint arXiv:2207.09514},
  year   = {2022}
}

备注

To appear in Interspeech 2022