中文

FakeSound:深度伪造通用音频检测

声音 2024-06-13 v1 音频与语音处理

摘要

随着音频生成技术的发展,生成模型可以产生高度逼真的音频。然而,深度伪造通用音频的滥用可能带来负面影响。因此,我们提出了新的任务——深度伪造通用音频检测,其旨在识别音频内容是否被操纵并定位深度伪造区域。利用自动化操纵管线,我们提出了一个名为 FakeSound 的数据集,用于深度伪造通用音频检测,样本可在网站 https://FakeSoundData.github.io 查看。人类在所有测试集上的平均二进制准确率始终低于 0.6,这表明人类在辨别深度伪造音频方面存在困难,确认了 FakeSound 数据集的有效性。提出一种利用通用音频预训练模型的深度伪造检测模型作为基准系统。实验结果表明,所提模型的性能在深度伪造语音检测和人类测试者方面均超越了当前最好的成果。

关键词

引用

@article{arxiv.2406.08052,
  title  = {FakeSound: Deepfake General Audio Detection},
  author = {Zeyu Xie and Baihan Li and Xuenan Xu and Zheng Liang and Kai Yu and Mengyue Wu},
  journal= {arXiv preprint arXiv:2406.08052},
  year   = {2024}
}

备注

Accepted by INTERSPEECH 2024