基于Transformer的音频深度伪造检测的持续学习
声音
2024-09-11 v1 音频与语音处理
摘要
本文提出了一种新颖的音频深度伪造检测框架,其两个主要目标是:i)在可用的伪造数据上达到尽可能高的准确率,以及ii)以少样本学习的方式在新的伪造数据上有效执行持续学习。具体来说,我们使用各种深度音频生成方法收集了大量的音频深度伪造数据。这些数据通过额外的增强方法进一步处理,以增加在压缩、远场录音、噪声和其他失真情况下的多样性。然后,我们采用音频频谱图Transformer作为音频深度伪造检测模型。因此,所提出的方法在各种基准数据集上取得了有前景的性能。此外,我们提出了一个持续学习插件模块,以使用尽可能少的新的伪造类型标记数据点最有效地更新训练好的模型。所提出的方法在使用少得多的标记数据点的情况下,优于传统的直接微调方法。
引用
@article{arxiv.2409.05924,
title = {Continuous Learning of Transformer-based Audio Deepfake Detection},
author = {Tuan Duy Nguyen Le and Kah Kuan Teh and Huy Dat Tran},
journal= {arXiv preprint arXiv:2409.05924},
year = {2024}
}
备注
Submitted to INTERSPEECH 2024