迈向鲁棒的音频深度伪造检测:面向持续学习的演进基准
声音
2024-08-14 v3 音频与语音处理
摘要
GPT-4、GPT-4o 和 Claude 系列等先进大语言模型的兴起,使得伪造音频检测日益具有挑战性。传统微调方法难以跟上合成语音不断演进的步伐,需要能够适应新音频同时保留检测旧类型能力的持续学习方法。持续学习作为检测新出现的深度伪造音频同时保持对旧类型性能的有效工具,缺乏一个构建良好且用户友好的评估框架。为填补这一空白,我们引入了 EVDA,一个用于评估深度伪造音频检测中持续学习方法的基准。EVDA 包含来自 Anti-Spoofing Voice 系列、中文伪造音频检测系列的数据集,以及由 GPT-4 和 GPT-4o 等模型新生成的深度伪造音频。它支持多种持续学习技术,如 Elastic Weight Consolidation (EWC)、Learning without Forgetting (LwF),以及 Regularized Adaptive Weight Modification (RAWM) 和 Radian Weight Modification (RWM) 等近期方法。此外,EVDA 通过提供用于集成新持续学习方法的开放接口,促进了鲁棒算法的开发。
引用
@article{arxiv.2405.08596,
title = {Towards Robust Audio Deepfake Detection: A Evolving Benchmark for Continual Learning},
author = {Xiaohui Zhang and Jiangyan Yi and Jianhua Tao},
journal= {arXiv preprint arXiv:2405.08596},
year = {2024}
}