中文

通过潜在空间精炼与增强实现音频深度伪造检测的通用化

音频与语音处理 2025-01-27 v1 声音

摘要

语音合成技术的进步,如文本转语音(TTS)和语音转换(VC),使得检测深度伪造语音日益具有挑战性。防伪措施常常在面对未遇到的攻击时难以有效泛化。为此,我们提出一种新策略,集成潜在空间精炼(LSR)和潜在空间增强(LSA),以提高深度伪造检测系统的泛化能力。LSR通过为作弊类别引入多个可学习原型,来精炼潜在空间,从而更好地捕捉作弊数据内部的细微差异。LSA通过在潜在空间直接应用增强技术,进一步多样化作弊数据表示,使模型能够学习更广泛的作弊模式。我们在四个代表性数据集上进行评估,即ASVspoof 2019 LA、ASVspoof 2021 LA和DF,以及In-The-Wild。结果表明,LSR和LSA单独使用效果良好,其集成实现了与当前最先进方法相当或更优的成绩。

关键词

引用

@article{arxiv.2501.14240,
  title  = {Generalizable Audio Deepfake Detection via Latent Space Refinement and Augmentation},
  author = {Wen Huang and Yanmei Gu and Zhiming Wang and Huijia Zhu and Yanmin Qian},
  journal= {arXiv preprint arXiv:2501.14240},
  year   = {2025}
}

备注

Accepted to ICASSP 2025