中文

为何语音深度伪造检测器无法泛化:开放世界中的检测极限

密码学与安全 2025-09-26 v1 声音 音频与语音处理

摘要

语音深度伪造检测器通常在干净、基准风格的条件下进行评估,但实际部署 occurs 在一个开放的世界中,包含变化的设备、采样率、编解码器、环境以及攻击家族。这导致 AI-based 检测器产生“覆盖债务”:每一种新条件都会与现有条件相乘,产生数据盲区,这些盲区的增长速度超过了数据收集的速度。由于攻击者可以针对这些未覆盖的区域进行攻击,最坏情况下的性能(而非平均的基准得分)决定了安全性。为演示覆盖债务问题的影响,我们分析了最近一个跨测试框架的结果。按真实域和假造发布年份分组分析性能时,出现两种模式:较新的合成器擦除检测器依赖的旧有人工特征,另外,对话式语音域(如会议、访谈、社交媒体)始终是最难以保护的领域。这些发现表明,仅依靠检测器而不应用于高风险决策。检测器应被视于包含来源验证、人格凭证和政策防护等分层防御系统中的辅助信号。

关键词

引用

@article{arxiv.2509.20405,
  title  = {Why Speech Deepfake Detectors Won't Generalize: The Limits of Detection in an Open World},
  author = {Visar Berisha and Prad Kadambi and Isabella Lenz},
  journal= {arXiv preprint arXiv:2509.20405},
  year   = {2025}
}