中文

攻击不可知数据集:面向音频 DeepFake 检测的泛化与稳定性

声音 2022-10-13 v2 机器学习

摘要

音频 DeepFake 能够生成高质量且具说服力的语音,并因其潜在应用(如冒充或假新闻)而构成威胁。检测此类篡改的方法应具备良好的泛化性与稳定性,从而对抗未显式纳入训练的技法的攻击时保持鲁棒。本工作中,我们引入 Attack Agnostic Dataset——由两个音频 DeepFake 与一个反欺骗数据集组合而成,得益于对攻击的互斥使用,可提升检测方法的泛化能力。我们对当前 DeepFake 检测方法进行了透彻分析,并考量不同音频特征(前端)。此外,我们提出一种基于 LCNN 且采用 LFCC 与梅尔谱图前端的模型,其不仅具有优良的泛化与稳定性表现,且较基于 LFCC 的模型有所提升——我们在所有折上降低了标准差,并在两个折上将 EER 降低至多 5%。

关键词

引用

@article{arxiv.2206.13979,
  title  = {Attack Agnostic Dataset: Towards Generalization and Stabilization of Audio DeepFake Detection},
  author = {Piotr Kawa and Marcin Plata and Piotr Syga},
  journal= {arXiv preprint arXiv:2206.13979},
  year   = {2022}
}

备注

Proceedings of INTERSPEECH 2022 (Updated version: corrected ASVspoof dataset description)