语音深度伪造检测综述
声音
2025-07-16 v2 密码学与安全
多媒体
音频与语音处理
摘要
智能设备的普及导致多媒体内容呈指数级增长。然而,深度学习的进步也使得高度复杂的深度伪造内容(包括语音深度伪造)得以创建,这些内容通过生成逼真的语音和传播错误信息构成了严重威胁。为了应对这一问题,已经组织了多项挑战赛来推动语音深度伪造检测技术的发展。在本综述中,我们系统分析了截至2024年3月发表的200多篇论文。我们对检测流程中的每个组成部分进行了全面回顾,包括模型架构、优化技术、泛化能力、评估指标、性能比较、可用数据集和开源可用性。针对每个方面,我们评估了最新进展并讨论了当前挑战。此外,我们探讨了部分深度伪造检测、跨数据集评估以及对抗攻击防御等新兴主题,同时提出了有前景的研究方向。本综述不仅确定了当前最先进的技术,为未来实验建立强基线,还为旨在增强语音深度伪造检测系统的研究人员提供了明确指导。
引用
@article{arxiv.2404.13914,
title = {A Survey on Speech Deepfake Detection},
author = {Menglu Li and Yasaman Ahmadiadli and Xiao-Ping Zhang},
journal= {arXiv preprint arXiv:2404.13914},
year = {2025}
}
备注
38 pages. This paper has been accepted by ACM Computing Surveys