用于目标说话人提取的条件扩散模型
音频与语音处理
2023-10-10 v1 机器学习
声音
摘要
我们提出 DiffSpEx,一种基于通过随机微分方程的得分生成建模的目标说话人提取生成方法。DiffSpEx 在复短时傅里叶变换域中部署连续时间随机扩散过程,从目标说话人源出发并收敛到以混合源为中心的高斯分布。对于逆时过程,一个参数化得分函数以目标说话人嵌入为条件,从混合源中提取目标说话人。我们利用 ECAPA-TDNN 目标说话人嵌入,并交替以 SDE 时间嵌入和目标说话人嵌入为得分函数的条件。DiffSpEx 的潜力在 WSJ0-2mix 数据集上得到展示,取得了 12.9 dB 的 SI-SDR 和 3.56 的 NISQA 分数。此外,我们表明将预训练的 DiffSpEx 模型微调至特定说话人可进一步提升性能,从而实现目标说话人提取中的个性化。
引用
@article{arxiv.2310.04791,
title = {Conditional Diffusion Model for Target Speaker Extraction},
author = {Theodor Nguyen and Guangzhi Sun and Xianrui Zheng and Chao Zhang and Philip C Woodland},
journal= {arXiv preprint arXiv:2310.04791},
year = {2023}
}
备注
5 pages, 4 figures, submitted to ICASSP 2024