DDTSE:用于目标语音提取的判别扩散模型
音频与语音处理
2024-10-08 v2 机器学习
声音
摘要
扩散模型在语音增强任务中受到关注,为传统的判别方法提供了替代方案。然而,关于多说话人噪声条件下目标语音提取的研究仍相对匮乏。此外,扩散方法优越的质量通常以更慢的推理速度为代价。本文中,我们提出用于目标语音提取的判别扩散模型(DDTSE)。我们采用与扩散模型相同的前向过程,并利用类似于判别方法的重构损失。此外,我们设计了一种两阶段训练策略,以在模型训练期间模拟推理过程。DDTSE不仅可作为独立系统工作,还能在无额外重训练的情况下进一步提升判别模型的性能。实验结果表明,与常规扩散模型相比,DDTSE不仅获得了更高的感知质量,还将推理过程加速了3倍。
引用
@article{arxiv.2309.13874,
title = {DDTSE: Discriminative Diffusion Model for Target Speech Extraction},
author = {Leying Zhang and Yao Qian and Linfeng Yu and Heming Wang and Hemin Yang and Long Zhou and Shujie Liu and Yanmin Qian},
journal= {arXiv preprint arXiv:2309.13874},
year = {2024}
}
备注
Accepted by SLT2024