中文

FakeSound2:面向可解释且通用的深度伪造声音检测基准

声音 2025-09-29 v2 音频与语音处理

摘要

生成音频的快速发展引发伦理和安全顾虑,制造的数据制造了恶意用途的风险,使得深度伪造声音检测成为重要的防护措施。尽管已有研究探索了这一任务,但现有方法主要关注二元分类,未能解释操作如何发生、来源何处,或对未见来源的泛化——从而限制了检测的可解释性和可靠性。为克服这些限制,我们提出了 FakeSound2,一个旨在超越二元准确率推进深度伪造声音检测的基准。FakeSound2 横跨三个维度进行模型评估:局部化、可追溯性和泛化,覆盖 6 种操纵类型和 12 种多样化来源。实验结果表明,尽管当前系统实现了高分类准确率,但它们在识别伪造模式分布和提供可靠解释方面仍感到挑战。通过凸显这些差距,FakeSound2 建立了一个全面的基准,揭示了关键挑战,旨在促进可信赖的音频认证方法的稳健、可解释和通用化。

关键词

引用

@article{arxiv.2509.17162,
  title  = {FakeSound2: A Benchmark for Explainable and Generalizable Deepfake Sound Detection},
  author = {Zeyu Xie and Yaoyun Zhang and Xuenan Xu and Yongkang Yin and Chenxing Li and Mengyue Wu and Yuexian Zou},
  journal= {arXiv preprint arXiv:2509.17162},
  year   = {2025}
}