统一去混响、去噪、说话人计数、分离与提取的单一语音增强模型
音频与语音处理
2023-10-13 v1 声音
摘要
我们提出一种多任务通用语音增强(MUSE)模型,能够执行五项语音增强(SE)任务:去混响、去噪、语音分离(SS)、目标说话人提取(TSE)和说话人计数。这是通过将两个模块集成到 SE 模型中实现的:1) 一个内部分离模块,同时进行说话人计数与分离;2) 一个 TSE 模块,利用目标说话人线索从内部分离输出中提取目标语音。该模型被训练为在给定目标说话人线索时执行 TSE,否则执行 SS。通过训练模型去除噪声与混响,我们使模型能够以单一模型应对上述五项任务,这是此前尚未实现的。评估结果表明,所提出的 MUSE 模型能够利用单一模型成功处理多种任务。
引用
@article{arxiv.2310.08277,
title = {A Single Speech Enhancement Model Unifying Dereverberation, Denoising, Speaker Counting, Separation, and Extraction},
author = {Kohei Saijo and Wangyou Zhang and Zhong-Qiu Wang and Shinji Watanabe and Tetsunori Kobayashi and Tetsuji Ogawa},
journal= {arXiv preprint arXiv:2310.08277},
year = {2023}
}
备注
6 pages, 4 figures, 2 tables, accepted by ASRU2023