中文

音频深度伪造系统的开放集源追踪

音频与语音处理 2025-07-10 v1 声音

摘要

现有研究在音频深度伪造系统的源追踪方面主要聚焦于封闭集场景,而评估开放集性能的研究仅限于少数未出现的系统。鉴于不断涌现的音频深度伪造系统,稳健的开放集源追踪显得尤为关键。我们借鉴Interspeech 2025专题源追踪会议的协议,对方法进行评估,以提高开放集源追踪性能。我们引入了一种针对外分布(OOD)检测的新型适配能量分数,即Softmax能量(SME)。我们发现,将典型温度缩放能量分数替换为SME,可在标准FPR95(在真正率为95%时的假正率)指标上实现约31%的相对平均改进。我们进一步探索了SME引导的训练以及复制合成、编解码和混响增强,最终将FPR95提升至8.3%。

关键词

引用

@article{arxiv.2507.06470,
  title  = {Open-Set Source Tracing of Audio Deepfake Systems},
  author = {Nicholas Klein and Hemlata Tak and Elie Khoury},
  journal= {arXiv preprint arXiv:2507.06470},
  year   = {2025}
}

备注

Accepted by INTERSPEECH 2025 as part of the special session "Source Tracing: The Origins of Synthetic or Manipulated Speech"