中文

利用专家混合架构提升语音深度伪造检测性能

声音 2024-09-25 v1 人工智能 音频与语音处理

摘要

语音深度伪造对个人安全和内容真实性构成重大威胁。文献中已提出多种检测器,这些系统面临的主要挑战之一是在未见数据上的泛化能力,以在广泛的数据集中识别伪造信号。本文提出了一种利用专家混合架构增强语音深度伪造检测性能的新方法。专家混合框架因其能够专精于不同类型的输入并有效处理数据变异性,非常适合语音深度伪造检测任务。与传统单一模型或集成方法相比,该方法在未见数据上展现出更优的泛化性和适应性。此外,其模块化结构支持可扩展更新,使其在保持高检测精度的同时,更灵活地应对深度伪造技术不断演变的复杂性。我们提出了一种高效、轻量级的门控机制,为每个输入动态分配专家权重,以优化检测性能。跨多个数据集的实验结果表明了我们所提方法的有效性和潜力。

关键词

引用

@article{arxiv.2409.16077,
  title  = {Leveraging Mixture of Experts for Improved Speech Deepfake Detection},
  author = {Viola Negroni and Davide Salvi and Alessandro Ilic Mezza and Paolo Bestagini and Stefano Tubaro},
  journal= {arXiv preprint arXiv:2409.16077},
  year   = {2024}
}

备注

Submitted to ICASSP 2025