中文

面向可靠音频深度伪造归因与模型识别:基于多层自编码器的框架

声音 2025-10-13 v3 计算机视觉与模式识别 音频与语音处理

摘要

音频深度伪造的快速传播构成了对数字通信信任的日益严重威胁。尽管检测方法已取得进展,但对音频深度伪造来源模型的归因仍是一个备受忽视且至关重要的挑战。本文介绍了 LAVA(Layered Architecture for Voice Attribution),一个用于音频深度伪造检测和模型识别的分层框架,利用由注意力增强的潜在表示构成的卷积自编码器提取的特征——该自编码器仅在假音频上进行训练。两个专用分类器在这些特征上运行:音频深度伪造归因(ADA),用于识别生成技术;音频深度伪造模型识别(ADMR),用于识别特定的生成模型实例。为提高在开放集条件下的鲁棒性,我们采用置信度基准拒绝阈值。在 ASVspoof2021、FakeOrReal 和 CodecFake 数据集上实验显示,ADA 分类器在所有数据集上实现 95% 以上的 F1 分数,ADMR 模块在六个类别上达到 96.31% 的宏平均 F1 分数。额外测试在 ASVpoof2019 LA 上的未见攻击以及误差传播分析均确认 LAVA 的鲁棒性和可靠性。该框架通过在公开基准测试上进行监督式方法,推动了深度伪造归因和模型识别在开放集条件下的发展,同时公开发布了模型和代码。模型和代码可在 https://www.github.com/adipiz99/lava-framework 获取。

关键词

引用

@article{arxiv.2508.02521,
  title  = {Towards Reliable Audio Deepfake Attribution and Model Recognition: A Multi-Level Autoencoder-Based Framework},
  author = {Andrea Di Pierno and Luca Guarnera and Dario Allegra and Sebastiano Battiato},
  journal= {arXiv preprint arXiv:2508.02521},
  year   = {2025}
}