音频深度伪造系统的开放集源追踪
音频与语音处理
2025-07-10 v1 声音
摘要
现有研究在音频深度伪造系统的源追踪方面主要聚焦于封闭集场景,而评估开放集性能的研究仅限于少数未出现的系统。鉴于不断涌现的音频深度伪造系统,稳健的开放集源追踪显得尤为关键。我们借鉴Interspeech 2025专题源追踪会议的协议,对方法进行评估,以提高开放集源追踪性能。我们引入了一种针对外分布(OOD)检测的新型适配能量分数,即Softmax能量(SME)。我们发现,将典型温度缩放能量分数替换为SME,可在标准FPR95(在真正率为95%时的假正率)指标上实现约31%的相对平均改进。我们进一步探索了SME引导的训练以及复制合成、编解码和混响增强,最终将FPR95提升至8.3%。
引用
@article{arxiv.2507.06470,
title = {Open-Set Source Tracing of Audio Deepfake Systems},
author = {Nicholas Klein and Hemlata Tak and Elie Khoury},
journal= {arXiv preprint arXiv:2507.06470},
year = {2025}
}
备注
Accepted by INTERSPEECH 2025 as part of the special session "Source Tracing: The Origins of Synthetic or Manipulated Speech"