中文

统一去混响、去噪、说话人计数、分离与提取的单一语音增强模型

音频与语音处理 2023-10-13 v1 声音

摘要

我们提出一种多任务通用语音增强(MUSE)模型,能够执行五项语音增强(SE)任务:去混响、去噪、语音分离(SS)、目标说话人提取(TSE)和说话人计数。这是通过将两个模块集成到 SE 模型中实现的:1) 一个内部分离模块,同时进行说话人计数与分离;2) 一个 TSE 模块,利用目标说话人线索从内部分离输出中提取目标语音。该模型被训练为在给定目标说话人线索时执行 TSE,否则执行 SS。通过训练模型去除噪声与混响,我们使模型能够以单一模型应对上述五项任务,这是此前尚未实现的。评估结果表明,所提出的 MUSE 模型能够利用单一模型成功处理多种任务。

关键词

引用

@article{arxiv.2310.08277,
  title  = {A Single Speech Enhancement Model Unifying Dereverberation, Denoising, Speaker Counting, Separation, and Extraction},
  author = {Kohei Saijo and Wangyou Zhang and Zhong-Qiu Wang and Shinji Watanabe and Tetsunori Kobayashi and Tetsuji Ogawa},
  journal= {arXiv preprint arXiv:2310.08277},
  year   = {2023}
}

备注

6 pages, 4 figures, 2 tables, accepted by ASRU2023