深度伪造语音检测的通用模型:多样化真实资源还是多样化AI生成器
声音
2026-04-15 v2 人工智能
摘要
本文分析了影响深度伪造语音检测(DSD)模型性能和通用性的两个主要因素:真实资源(BR)或AI生成器(AG)。为此,我们首先提出了一种基于深度学习的模型,称为基线。然后,我们通过基线实验表明真实资源(BR)和AI生成器(AG)因素如何影响推理过程中用于检测伪造或真实输入音频的阈值分数。根据实验结果,我们提出了一种数据集,该数据集复用公共深度伪造语音检测(DSD)数据集,并在真实资源(BR)与AI生成器(AG)之间取得平衡。然后我们在所提出的数据集上训练各种基于深度学习的模型,并在不同基准数据集上进行跨数据集评估。跨数据集评估结果证明,真实资源(BR)与AI生成器(AG)的平衡是训练和实现通用深度伪造语音检测(DSD)模型的关键因素。
引用
@article{arxiv.2603.27557,
title = {A General Model for Deepfake Speech Detection: Diverse Bonafide Resources or Diverse AI-Based Generators},
author = {Lam Pham and Khoi Vu and Dat Tran and David Fischinger and Alexander Schindler and Martin Boyer and Ian McLoughlin},
journal= {arXiv preprint arXiv:2603.27557},
year = {2026}
}