中文

基于神经音频编解码器分类的深度伪造语音来源追踪

声音 2025-08-05 v3 音频与语音处理

摘要

近期,神经音频编解码器(neural audio codec)基座的语音生成(CoSG)模型取得了显著进展,我们指出由CoSG系统生成的深度伪造语音称为编解码器深度伪造(CodecFake)。虽然现有针对CodecFake的反欺骗研究主要集中在验证音频样本真实性,但几乎没有关注追踪这些深度伪造所使用的CoSG。CodecFake生成过程中,包括语音到单元编码、离散单元建模和单元到语音解码在内的多个环节,都根植于神经音频编解码器之中。基于此,我们提出一种通过神经音频编解码器分类实现CodecFake来源追踪的方法。我们在CodecFake+数据集上进行的实验结果,为CodecFake来源追踪的可行性提供了有前景的初始证据,同时也凸显了值得进一步调查的若干挑战。

关键词

引用

@article{arxiv.2505.12994,
  title  = {Codec-Based Deepfake Source Tracing via Neural Audio Codec Taxonomy},
  author = {Xuanjun Chen and I-Ming Lin and Lin Zhang and Jiawei Du and Haibin Wu and Hung-yi Lee and Jyh-Shing Roger Jang},
  journal= {arXiv preprint arXiv:2505.12994},
  year   = {2025}
}

备注

Accepted by Interspeech 2025; Update table 3/4