中文

神经编解码器溯源:面向开放集条件下的全面归因

声音 2025-01-14 v1 人工智能 音频与语音处理

摘要

当前音频深度伪造检测的研究正逐渐从二分类任务向多类任务过渡,这被称为音频深度伪造溯源任务。然而,现有的溯源研究仅考虑了闭集场景,并未考虑开集条件带来的挑战。在本文中,我们定义了神经编解码器溯源(NCST)任务,该任务能够执行开集神经编解码器分类和可解释的 ALM 检测。具体而言,我们为 NCST 任务构建了 ST-Codecfake 数据集,其中包含由 11 种最先进的神经编解码器方法生成的双语音频样本以及基于 ALM 的分布外(OOD)测试样本。此外,我们建立了一个全面的溯源基准,以评估开集条件下的 NCST 模型。实验结果表明,尽管 NCST 模型在分布内(ID)分类和 OOD 检测中表现良好,但它们在对未见真实音频进行分类时缺乏鲁棒性。ST-codecfake 数据集和代码已公开提供。

关键词

引用

@article{arxiv.2501.06514,
  title  = {Neural Codec Source Tracing: Toward Comprehensive Attribution in Open-Set Condition},
  author = {Yuankun Xie and Xiaopeng Wang and Zhiyong Wang and Ruibo Fu and Zhengqi Wen and Songjun Cao and Long Ma and Chenxing Li and Haonnan Cheng and Long Ye},
  journal= {arXiv preprint arXiv:2501.06514},
  year   = {2025}
}