中文

基于模块化统计变换的音频深度伪造检测无监督域适应

声音 2026-03-10 v1

摘要

在一个数据集上训练的音频深度伪造检测系统,往往在部署到不同来源的数据时会因录音条件、合成方法和声学环境的分布性变化而失效。我们提出了一种模块化管道,用于无监督域适应,将预训练的 Wav2Vec 2.0 嵌入与统计变换相结合,以提高跨域泛化能力,而无需目标数据标签。我们的 метод应用幂变换进行特征归一化,采用方差分析(ANOVA)基于特征选择,联合主成分分析(PCA)进行域无关的降维,然后通过 CORAL 对齐匹配源和目标的协方差结构,最终通过逻辑回归进行分类。我们在两个跨域迁移场景上进行评估:ASVspoof 2019 LA 到 Fake-or-Real (FoR) 以及 FoR 到 ASVspoof,实现了 62.7--63.6% 的准确率,在真实和伪造类别之间保持平衡的性能。系统性的消融实验揭示,特征选择 (+3.5%) 和 CORAL 对齐 (+3.2%) 提供了最大的单个贡献,完整管道相对于基线提高了 10.7% 的准确率。尽管性能在较窄域检测 (94-96%) 之下仍显不足,但我们的管道提供了透明度和模块化设计,适用于需要可解释决策的部署场景。

关键词

引用

@article{arxiv.2603.07935,
  title  = {Unsupervised Domain Adaptation for Audio Deepfake Detection with Modular Statistical Transformations},
  author = {Urawee Thani and Gagandeep Singh and Priyanka Singh},
  journal= {arXiv preprint arXiv:2603.07935},
  year   = {2026}
}

备注

9 pages, 4 figures