中文

面向音频深度伪造解释的数据驱动扩散方法

音频与语音处理 2025-11-25 v1 人工智能 机器学习

摘要

评估如 SHAP 和 LRP 等解释技术在音频深度伪造检测情境下的可解释性,由于缺乏清晰的 ground truth 注释而具有挑战性。在能够获得 ground truth 的情况下, 我们发现这些方法难以提供准确的解释。为此, 本文提出一种新颖的数据驱动方法来识别深度伪造音频中的人工区域。我们考虑配对的真实音频和 vocoded 音频, 并使用时频表示的差异作为 ground-truth 解释。差分信号随后作为监督信号训练扩散模型, 以在给定的 vocoded 音频中暴露深度伪造人工区域。在 VocV4 和 LibriSeVoc 数据集上的实验结果表明, 本方法在定性和定量方面均优于传统解释技术。

关键词

引用

@article{arxiv.2506.03425,
  title  = {A Data-Driven Diffusion-based Approach for Audio Deepfake Explanations},
  author = {Petr Grinberg and Ankur Kumar and Surya Koppisetti and Gaurav Bharaj},
  journal= {arXiv preprint arXiv:2506.03425},
  year   = {2025}
}

备注

5 pages, 3 figures, accepted at Interspeech 2025