面向可泛化音频深度伪造检测的低秩适配器专家混合模型
音频与语音处理
2025-09-18 v1 机器学习
声音
摘要
基础模型如 Wav2Vec2 在语音任务中优秀地完成表征学习,包括音频深度伪造检测。然而,它们在针对固定的一组真实和伪造音频片段进行微调后,往往无法泛化到训练中未表示的新型深度伪造方法。为此,我们提出一种基于低秩适配器 (LoRA) 专家混合的方法,将多个 LoRA 集成到模型的注意力层中。一种路由机制选择性地激活专门的专家,以增强对不断演变的深度伪造攻击的适应性。实验结果表明,我们的方法在域内和域外场景中均优于标准微调,显著降低了平均误差率 (EER)。值得注意的是,我们的最佳 MoE-LoRA 模型将平均域外 EER 从 8.55% 降低至 6.08%,展示了其在实现可泛化音频深度伪造检测方面的有效性。
引用
@article{arxiv.2509.13878,
title = {Mixture of Low-Rank Adapter Experts in Generalizable Audio Deepfake Detection},
author = {Janne Laakkonen and Ivan Kukanov and Ville Hautamäki},
journal= {arXiv preprint arXiv:2509.13878},
year = {2025}
}
备注
6 pages, 3 figures, 1 table