基于注意力机制的鲁棒语音深度伪造检测中的混合专家模型
声音
2025-09-23 v1
摘要
AI 生成的语音正在日益常用于日常生活中, 为虚拟助手、无障碍工具等应用提供动力. 然而, 它也被用于欺骗目的, 如冒充、误导信息传播和生物识别欺骗. 随着语音深度伪造几乎无法区分于真实人类语音, 对于鲁棒检测方法和有效防御措施的需求变得至关紧迫. 本文提出了 ISPL 在 IH&MMSec 2025 SAFE 挑战赛中的提交方案, 该系统在所有任务中名列第一. 我们的解决方案基于混合专家架构, 引入了一种新的音频深度伪造检测方法. 该系统利用注意力机制的门控网络动态加权每个专家的输出, 将多个最先进的检测器组合. 在此设计中, 每个专家通过学习捕获相同输入的不同互补方面来发展其对共享训练数据的专门化理解. 实验结果表明, 我们的方法在多个数据集上超越了现有方法. 我们进一步评估和分析了该系统在 SAFE 挑战赛中的性能.
引用
@article{arxiv.2509.17585,
title = {Attention-based Mixture of Experts for Robust Speech Deepfake Detection},
author = {Viola Negroni and Davide Salvi and Alessandro Ilic Mezza and Paolo Bestagini and Stefano Tubaro},
journal= {arXiv preprint arXiv:2509.17585},
year = {2025}
}
备注
Accepted @ IEEE WIFS 2025