中文

基于信息瓶颈增强的通用语音深度伪造检测

声音 2025-09-30 v1 人工智能

摘要

神经语音合成技术已实现高度逼真的语音深度伪造,构成重大安全风险。由于跨作弊方法的分布迁移以及说话人、信道和录音条件的多样性,语音深度伪造检测颇具挑战性。我们探索通过学习共享判别特征以实现稳健检测,提出信息瓶颈增强置信度感知对抗网络(IB-CAAN)。置信度引导的对抗对齐可适当抑制作弊特定伪影,同时不消除判别线索;而信息瓶颈则去除杂质变异,保留可迁移特征。在 ASVspoof 2019/2021、ASVspoof 5 以及野外数据集上的实验表明,IB-CAAN 在基线模型和众多基准上均显著优于基线方法,实现了最新进展。

关键词

引用

@article{arxiv.2509.23618,
  title  = {Generalizable Speech Deepfake Detection via Information Bottleneck Enhanced Adversarial Alignment},
  author = {Pu Huang and Shouguang Wang and Siya Yao and Mengchu Zhou},
  journal= {arXiv preprint arXiv:2509.23618},
  year   = {2025}
}