用于噪声鲁棒合成语音检测的双分支知识蒸馏
声音
2024-04-17 v2 音频与语音处理
摘要
大多数合成语音检测(SSD)研究聚焦于提升在标准无噪声数据集上的性能。然而在实际场景中,通常存在噪声干扰,导致 SSD 系统性能显著下降。为提升噪声鲁棒性,本文提出一种双分支知识蒸馏合成语音检测(DKDSSD)方法。具体而言,设计了干净教师分支与噪声学生分支的并行数据流,并提出交互融合模块与基于响应的师生范式,从数据分布与决策两个角度引导噪声数据的训练。在噪声学生分支中,首先引入语音增强进行去噪,旨在降低强噪声的干扰。所提出的交互融合将去噪特征与噪声特征结合,以减轻语音失真的影响并确保与干净分支数据分布的一致性。师生范式将学生的决策空间映射到教师的决策空间,使噪声语音表现与干净语音相似。此外,采用联合训练方法优化两个分支以实现全局最优。基于多个数据集的实验结果表明,所提方法在噪声环境下有效,并在跨数据集实验中保持性能。源代码见 https://github.com/fchest/DKDSSD。
引用
@article{arxiv.2310.08869,
title = {Dual-Branch Knowledge Distillation for Noise-Robust Synthetic Speech Detection},
author = {Cunhang Fan and Mingming Ding and Jianhua Tao and Ruibo Fu and Jiangyan Yi and Zhengqi Wen and Zhao Lv},
journal= {arXiv preprint arXiv:2310.08869},
year = {2024}
}