中文

Wav2DF-TSL:基于高效预训练与分层专家融合的鲁棒音频深度伪造检测两阶段学习

声音 2025-09-05 v1

摘要

近年来,自监督学习(SSL)模型在音频深度伪造检测(ADD)任务中取得了显著进展。然而,现有的 SSL 模型主要依赖大规模真实语音进行预训练,缺乏对欺骗样本的学习,导致在 ADD 任务的微调过程中容易受到域偏差的影响。为此,我们提出一种基于预训练与分层专家融合的两阶段学习策略(Wav2DF-TSL),用于鲁棒的音频深度伪造检测。在预训练阶段,我们使用适配器(adapters)从 3000 小时无标注的欺骗语音中高效学习伪影特征,在提升前端特征适应性的同时缓解灾难性遗忘。在微调阶段,我们提出分层自适应专家混合(HA-MoE)方法,通过多专家协作与门控路由动态融合多层次的欺骗线索。实验结果表明,所提方法在所有四个基准数据集上均显著优于基线系统,尤其是在跨域的 In-the-wild 数据集上,实现了 27.5% 的等错误率(EER)相对提升,超越了现有的最先进系统。索引词:音频深度伪造检测、自监督学习、参数高效微调、专家混合。

关键词

引用

@article{arxiv.2509.04161,
  title  = {Wav2DF-TSL: Two-stage Learning with Efficient Pre-training and Hierarchical Experts Fusion for Robust Audio Deepfake Detection},
  author = {Yunqi Hao and Yihao Chen and Minqiang Xu and Jianbo Zhan and Liang He and Lei Fang and Sian Fang and Lin Liu},
  journal= {arXiv preprint arXiv:2509.04161},
  year   = {2025}
}