FakeSound2:面向可解释且通用的深度伪造声音检测基准
声音
2025-09-29 v2 音频与语音处理
摘要
生成音频的快速发展引发伦理和安全顾虑,制造的数据制造了恶意用途的风险,使得深度伪造声音检测成为重要的防护措施。尽管已有研究探索了这一任务,但现有方法主要关注二元分类,未能解释操作如何发生、来源何处,或对未见来源的泛化——从而限制了检测的可解释性和可靠性。为克服这些限制,我们提出了 FakeSound2,一个旨在超越二元准确率推进深度伪造声音检测的基准。FakeSound2 横跨三个维度进行模型评估:局部化、可追溯性和泛化,覆盖 6 种操纵类型和 12 种多样化来源。实验结果表明,尽管当前系统实现了高分类准确率,但它们在识别伪造模式分布和提供可靠解释方面仍感到挑战。通过凸显这些差距,FakeSound2 建立了一个全面的基准,揭示了关键挑战,旨在促进可信赖的音频认证方法的稳健、可解释和通用化。
关键词
引用
@article{arxiv.2509.17162,
title = {FakeSound2: A Benchmark for Explainable and Generalizable Deepfake Sound Detection},
author = {Zeyu Xie and Yaoyun Zhang and Xuenan Xu and Yongkang Yin and Chenxing Li and Mengyue Wu and Yuexian Zou},
journal= {arXiv preprint arXiv:2509.17162},
year = {2025}
}