面向基于编解码器的深度伪造语音的通用源追踪
声音
2025-08-19 v3 密码学与安全
机器学习
音频与语音处理
摘要
近期尝试针对基于编解码器的深度伪造语音(CodecFake),即由神经音频编解码器语音生成(CoSG)模型生成的语音进行源追踪,表现有限。然而,如何利用模拟CoSG数据训练源追踪模型而又保持对真实CoSG生成音频的强大性能 remains an open challenge。本文表明,仅基于编解码器重绪合数据训练的模型倾向于过拟合非语音区域,难以泛化到未见内容。为缓解此挑战,我们引入了语义-声学源追踪网络(SASTNet),该网络联合利用Whisper进行语义特征编码,采用Wav2vec2和AudioMAE进行声学特征编码。我们提出的SASTNet在CodecFake+数据集的CoSG测试集上实现了最先进的性能,证明了其可靠的源追踪效果。
引用
@article{arxiv.2506.07294,
title = {Towards Generalized Source Tracing for Codec-Based Deepfake Speech},
author = {Xuanjun Chen and I-Ming Lin and Lin Zhang and Haibin Wu and Hung-yi Lee and Jyh-Shing Roger Jang},
journal= {arXiv preprint arXiv:2506.07294},
year = {2025}
}
备注
IEEE ASRU 2025