增强音频深度伪造检测的泛化能力:基于神经坍缩的采样与训练方法
声音
2024-04-22 v1 音频与语音处理
摘要
音频深度伪造检测中的泛化能力提出了重大挑战,在特定数据集上训练的模型通常难以检测在不同条件和未知算法下生成的深度伪造内容。虽然使用多样化数据集共同训练模型可以增强其泛化能力,但这会带来高昂的计算成本。为了解决这个问题,我们提出了一种基于神经坍缩的采样方法,应用于在不同数据集上训练的预训练模型,以创建一个新的训练数据库。我们以 ASVspoof 2019 数据集作为概念验证,实现了具有 Resnet 和 ConvNext 架构的预训练模型。我们的方法在未见数据上展示了相当的泛化能力,同时计算效率高,且所需训练数据更少。使用 In-the-wild 数据集进行了评估。
引用
@article{arxiv.2404.13008,
title = {Enhancing Generalization in Audio Deepfake Detection: A Neural Collapse based Sampling and Training Approach},
author = {Mohammed Yousif and Jonat John Mathew and Huzaifa Pallan and Agamjeet Singh Padda and Syed Daniyal Shah and Sara Adamski and Madhu Reddiboina and Arjun Pankajakshan},
journal= {arXiv preprint arXiv:2404.13008},
year = {2024}
}