MoLEx: 用于音频深度伪造检测的语音自监督模型中的LoRA专家混合
声音
2025-09-12 v1 多媒体
摘要
虽然基于自监督学习(SSL)的模型提升了音频深度伪造检测的准确性,但完全微调它们的计算成本很高。为此,我们提出了一种参数高效的框架,将低秩适配与专家混合路由器相结合,称为LoRA专家混合(MoLEx)。它在保留SSL模型预训练知识的同时,高效地仅微调选定的专家,降低了训练成本,同时保持了鲁棒的性能。推理过程中观察到的专家效用表明,路由器对相似攻击重新激活相同专家,但对新型欺骗则切换到其他专家,证实了MoLEx的领域感知适应性。MoLEx还通过允许训练额外专家而无需修改整个模型,为域适应提供了灵活性。我们在ASVSpoof 5数据集上主要评估了我们的方法,并在无增强的情况下在评估集上达到了最先进的(SOTA)等错误率(EER)5.56%。
引用
@article{arxiv.2509.09175,
title = {MoLEx: Mixture of LoRA Experts in Speech Self-Supervised Models for Audio Deepfake Detection},
author = {Zihan Pan and Sailor Hardik Bhupendra and Jinyang Wu},
journal= {arXiv preprint arXiv:2509.09175},
year = {2025}
}