中文

面向基于编解码器的深度伪造语音的通用源追踪

声音 2025-08-19 v3 密码学与安全 机器学习 音频与语音处理

摘要

近期尝试针对基于编解码器的深度伪造语音(CodecFake),即由神经音频编解码器语音生成(CoSG)模型生成的语音进行源追踪,表现有限。然而,如何利用模拟CoSG数据训练源追踪模型而又保持对真实CoSG生成音频的强大性能 remains an open challenge。本文表明,仅基于编解码器重绪合数据训练的模型倾向于过拟合非语音区域,难以泛化到未见内容。为缓解此挑战,我们引入了语义-声学源追踪网络(SASTNet),该网络联合利用Whisper进行语义特征编码,采用Wav2vec2和AudioMAE进行声学特征编码。我们提出的SASTNet在CodecFake+数据集的CoSG测试集上实现了最先进的性能,证明了其可靠的源追踪效果。

关键词

引用

@article{arxiv.2506.07294,
  title  = {Towards Generalized Source Tracing for Codec-Based Deepfake Speech},
  author = {Xuanjun Chen and I-Ming Lin and Lin Zhang and Haibin Wu and Hung-yi Lee and Jyh-Shing Roger Jang},
  journal= {arXiv preprint arXiv:2506.07294},
  year   = {2025}
}

备注

IEEE ASRU 2025