基于扩散模型的多通道语音增强自监督学习用于噪声条件下说话人验证
声音
2023-07-06 v1 音频与语音处理
摘要
本文提出 Diff-Filter,一种基于扩散概率模型的多通道语音增强方法,用于提升噪声与混响条件下的说话人验证性能。同时给出了一种利用自监督学习优势的新两步训练流程。第一阶段,Diff-Filter 通过使用基于打分的扩散模型进行时域语音滤波来训练。第二阶段,Diff-Filter 在自监督学习框架下与预训练的 ECAPA-TDNN 说话人验证模型联合优化。我们提出了一种基于等错误率的新型损失,该损失用于对未标注说话人信息的数据集进行自监督学习。所提方法在多通道说话人验证数据集 MultiSV 上进行了评估,并在噪声多通道条件下显示出性能的显著提升。
引用
@article{arxiv.2307.02244,
title = {Self-supervised learning with diffusion-based multichannel speech enhancement for speaker verification under noisy conditions},
author = {Sandipana Dowerah and Ajinkya Kulkarni and Romain Serizel and Denis Jouvet},
journal= {arXiv preprint arXiv:2307.02244},
year = {2023}
}