中文

说话人对抗性扰动的可移除性研究

音频与语音处理 2025-10-13 v1

摘要

近期对抗攻击的进展表明其在误导说话人识别模型方面效果显著,导致关于说话人身份的错误预测。相反,对抗性攻击的防御技术侧重于减少对抗性扰动对说话人属性提取的影响。这些技术并不寻求完全移除扰动并恢复原始语音。为此,本文研究说话人对抗性扰动的可移除性。具体而言,在三个情景下进行调查,这些情景假设扰动生成器的不同程度的知觉:无知、半知情和熟知。此外,我们考虑基于优化和基于 feedforward 的扰动生成方法。在 LibriSpeech 数据集上进行的实验表明:1) 在无知情场景中,说话人对抗性扰动无法被消除,尽管其对说话人属性提取的影响被减少;2) 在半知情场景中,说话人对抗性扰动无法完全被移除,但由 feedforward 模型生成的扰动可以显著降低;3) 在熟知情场景中,说话人对抗性扰动几乎被消除,允许恢复原始语音。音频样本可在 https://voiceprivacy.github.io/Perturbation-Generation-Removal/ 查看。

关键词

引用

@article{arxiv.2510.09504,
  title  = {A Study of the Removability of Speaker-Adversarial Perturbations},
  author = {Liping Chen and Chenyang Guo and Kong Aik Lee and Zhen-Hua Ling and Wu Guo},
  journal= {arXiv preprint arXiv:2510.09504},
  year   = {2025}
}