中文

深度伪造语音检测器的进化多目标融合

声音 2026-04-03 v1 人工智能 密码学与安全 机器学习 神经与进化计算

摘要

虽然基于大型自监督学习(SSL)模型的深度伪造语音检测器能够实现高准确率,但采用标准集成融合进一步提升鲁棒性往往会导致系统体积过大且收益递减。为此,我们提出一种进化多目标得分融合框架,联合最小化检测误差和系统复杂度。我们研究了两种由 NSGA-II 优化的编码方案:一种是用于得分平均的二进制编码的检测器选择,另一种是优化检测器权重以实现加权求和的实数编码方案。在 ASVspoof 5 数据集上进行实验,包含36个基于SSL的检测器。结果表明,我们获得的Pareto前沿超越了简单平均和逻辑回归基线。实数编码变体实现了2.37%的EER(0.0684 minDCF),并识别出能够实现SOTA性能且显著降低系统复杂度的配置,仅需一半的参数。我们的方法还提供了一组多样化的权衡解,使部署能够在准确性和计算成本之间进行权衡选择。

关键词

引用

@article{arxiv.2604.01330,
  title  = {Evolutionary Multi-Objective Fusion of Deepfake Speech Detectors},
  author = {Vojtěch Staněk and Martin Perešíni and Lukáš Sekanina and Anton Firc and Kamil Malinka},
  journal= {arXiv preprint arXiv:2604.01330},
  year   = {2026}
}

备注

Accepted to WCCI CEC 2026