上下文与转录文本提升公众人物深度伪造音频的检测效果
人工智能
2026-01-21 v1 声音
摘要
人类利用上下文来评估信息的真实性。然而,当前的音频深度伪造检测器仅分析音频文件,而不考虑上下文或转录文本。我们创建并分析了一个由记者提供的深度伪造数据集(JDD),包含255个公开的深度伪造样本,这些样本主要由70多位记者自2024年初以来贡献。我们还生成了一个由已故公众人物组成的合成音频数据集(SYN),并提出了一种新颖的基于上下文的音频深度伪造检测器(CADD)架构。此外,我们在两个大规模数据集上评估了性能:ITW和PV。我们表明,充足的上下文和/或转录文本可以显著提升音频深度伪造检测器的有效性。多个基线音频深度伪造检测器和传统分类器的性能(通过F1分数、AUC和EER衡量)在F1分数上可提升5%-37.58%,在AUC上提升3.77%-42.79%,在EER上提升6.17%-47.83%。我们进一步表明,CADD通过利用上下文和/或转录文本,对5种对抗性规避策略具有更强的鲁棒性,在所有实验中将性能下降幅度限制在平均仅-0.71%。代码、模型和数据集可在我们的项目页面获取:https://sites.northwestern.edu/nsail/cadd-context-based-audio-deepfake-detection(评审期间限制访问)。
引用
@article{arxiv.2601.13464,
title = {Context and Transcripts Improve Detection of Deepfake Audios of Public Figures},
author = {Chongyang Gao and Marco Postiglione and Julian Baldwin and Natalia Denisenko and Isabel Gortner and Luke Fosdick and Chiara Pulice and Sarit Kraus and V. S. Subrahmanian},
journal= {arXiv preprint arXiv:2601.13464},
year = {2026}
}