真实语音交叉测试揭示音频深度伪造检测系统的薄弱环节
声音
2025-09-12 v1 人工智能
计算与语言
摘要
音频深度伪造检测(ADD)模型通常使用将多种合成器组合的数据集进行评估,以单个等错误率(EER)报告性能。然而,这种方法会过度加权样本更多的合成器,导致其他合成器的代表性不足,降低EER的整体可靠性。此外,大多数ADD数据集缺乏多样化的真实语音,常常只有单一环境和语音风格(例如干净的阅读语音),限制了其在模拟现实场景方面的能力。为解决这些挑战,我们提出了一种称为“真实语音交叉测试”的新型评估框架,该框架包含多样化的真实语音数据集,并聚合EER,以实现更均衡的评估。我们的做法比传统评估方法更具鲁棒性和可解释性。我们对150多种合成器进行基准测试,覆盖九种真实语音类型,并发布一个新数据集以促进进一步的研究,访问链接为 https://github.com/cyaaronk/audio_deepfake_eval。
引用
@article{arxiv.2509.09204,
title = {Bona fide Cross Testing Reveals Weak Spot in Audio Deepfake Detection Systems},
author = {Chin Yuen Kwok and Jia Qi Yip and Zhen Qiu and Chi Hung Chi and Kwok Yan Lam},
journal= {arXiv preprint arXiv:2509.09204},
year = {2025}
}
备注
Published in Interspeech 2025