MDD:一种基于掩码扩散模型的防御对抗性扰动的说话人验证探测器
音频与语音处理
2025-08-27 v1 声音
摘要
说话人验证系统正在被部署到安全敏感的应用中,但仍高度易受对抗性扰动的攻击。本文提出了 Mask Diffusion Detector (MDD),一种基于\text{文本条件掩码扩散模型}的新型对抗性检测与净化框架。在训练期间,MDD 对 Mel 频谱图应用局部分割,并通过前向扩散过程逐步添加噪声,模拟干净语音特征的退化。随后,反向过程在输入文字稿的条件下重建干净的表示。与先前方法不同,MDD 不需要对抗性示例或大规模预训练。实验结果表明,MDD 取得了强大的对抗性检测性能,优于先前的状态方法,包括基于扩散的和基于神经编解码器的方法。此外,MDD 有效地净化了被对抗性操纵的语音,使说话人验证性能恢复到接近干净条件下的水平。这些发现表明了扩散基于的掩码策略在安全可靠的说话人验证系统方面的潜力。
引用
@article{arxiv.2508.19180,
title = {MDD: a Mask Diffusion Detector to Protect Speaker Verification Systems from Adversarial Perturbations},
author = {Yibo Bai and Sizhou Chen and Michele Panariello and Xiao-Lei Zhang and Massimiliano Todisco and Nicholas Evans},
journal= {arXiv preprint arXiv:2508.19180},
year = {2025}
}
备注
Accepted by APSIPA ASC 2025