面向深度音频伪造检测网络的泛化
声音
2024-04-10 v3 机器学习
音频与语音处理
摘要
当今的生成式神经网络使得大规模创建高质量合成语音成为可能。我们欢迎这项新技术的创造性使用,但也必须认识到其风险。随着合成语音被滥用于金钱与身份盗窃,我们需要一套广泛的深度伪造识别工具。此外,先前工作报道了深度分类器对未见音频生成器的泛化能力有限。我们研究了当前音频生成器的频域指纹。基于所发现的频率足迹,我们训练了出色的轻量检测器,其具备泛化能力。我们在 WaveFake 数据集及其扩展版本上报告了改进结果。为应对该领域的快速进展,我们通过额外考虑从新颖的 Avocodo 和 BigVGAN 网络抽取的采样扩展了 WaveFake 数据集。为便于说明,补充材料包含了生成器伪影的音频样本。
引用
@article{arxiv.2305.13033,
title = {Towards generalizing deep-audio fake detection networks},
author = {Konstantin Gasenzer and Moritz Wolter},
journal= {arXiv preprint arXiv:2305.13033},
year = {2024}
}
备注
Code available at: https://github.com/gan-police/audiodeepfake-detection