我们在音频深度伪造检测方面处于哪里?对生成模型和检测模型的系统性分析
声音
2025-03-25 v4 人工智能
音频与语音处理
摘要
文本语音合成 (TTS) 和语音转换 (VC) 利用生成式人工智能技术的最新进展使得能够生成高质量且逼真的人类语音。这给区分 AI 合成语音与真实人声带来日益增大的挑战,可能引发用于冒充、欺诈、散布虚假信息和诈骗的担忧。然而,现有的 AI 合成音频检测方法未能跟上,往往难以在多样化数据集上获得良好泛化。本文引入 SONAR,一个综合性的人工智能音频检测框架和基准,旨在为区分前沿 AI 合成听觉内容提供全面的评估。SONAR 包括来自 9 个多样化音频合成平台(包括领先的 TTS 提供商和最先进的 TTS 模型)的新型评估数据集。这一框架是首个在传统和基础模型基础检测系统上进行统一基准测试的人工智能音频检测框架。通过大量实验,我们(1)揭示了现有检测方法的局限性,表明基础模型具有更强的泛化能力,这可能是由于模型规模和预训练数据的规模和质量。(2)语音基础模型展现出强大的跨语言泛化能力,尽管仅在英语语音数据上进行微调,却在多语言环境中保持稳健的性能。这一发现也表明,音频深度伪造检测的主要挑战更倾向于合成音频的真实性和质量,而非语言特性。(3)我们探讨了few-shot 微调在改进泛化方面的有效性和效率,突显了其在特定用途(如针对特定实体或个人的个性化检测系统)的潜在价值。
引用
@article{arxiv.2410.04324,
title = {Where are we in audio deepfake detection? A systematic analysis over generative and detection models},
author = {Xiang Li and Pin-Yu Chen and Wenqi Wei},
journal= {arXiv preprint arXiv:2410.04324},
year = {2025}
}