基于 TasTas 解决预鸡尾酒会问题中的语音分离
音频与语音处理
2023-06-26 v4 声音
摘要
在本札记中,我们提出使用 TasTas \cite{shi2020speech} 以端到端方法解决预鸡尾酒会问题中的单通道语音分离。我们在公开 WSJ0-5mix 语料库上的实验取得了 10.41dB 的 SDR 提升。若在训练中采用在线语音数据重混增强 \cite{zeghidour2020wavesplit},则可达到 11.14dB 的 SDR 提升。我们已在 https://github.com/ShiZiqiang/dual-path-RNNs-DPRNNs-based-speech-separation 开源了对 DPRNN-TasNet 的重新实现,而我们的 TasTas 基于此 DPRNN-TasNet 实现构建,相信本文结果可轻松复现。
引用
@article{arxiv.2009.03692,
title = {Toward Speech Separation in The Pre-Cocktail Party Problem with TasTas},
author = {Ziqiang Shi and Jiqing Han},
journal= {arXiv preprint arXiv:2009.03692},
year = {2023}
}
备注
arXiv admin note: substantial text overlap with arXiv:1902.04891