DPM-TSE:一种用于目标声音提取的扩散概率模型
音频与语音处理
2023-10-11 v2 声音
摘要
常见的目标声音提取(TSE)方法主要依赖判别方法来分离目标声音,同时最小化来自非目标声源的干扰,在将目标从背景中分离出来方面成效不一。本研究引入DPM-TSE,一种基于扩散概率建模(DPM)的首次生成式目标声音提取方法,以实现更干净的目标声音渲染以及从非目标声音中改善的可分离性。该技术还通过引入针对噪声调度与采样步的校正方法,解决了DPM常见的背景噪声问题。该方法在FSD Kaggle 2018数据集上使用客观与主观质量指标进行了评估。结果表明,DPM-TSE在目标提取与纯净度方面的感知质量有显著提升。
引用
@article{arxiv.2310.04567,
title = {DPM-TSE: A Diffusion Probabilistic Model for Target Sound Extraction},
author = {Jiarui Hai and Helin Wang and Dongchao Yang and Karan Thakkar and Najim Dehak and Mounya Elhilali},
journal= {arXiv preprint arXiv:2310.04567},
year = {2023}
}
备注
Submitted to ICASSP 2024