中文

理解 SSL 模型在音频深度伪造模型归因中的优势与局限

音频与语音处理 2026-03-17 v1

摘要

音频深度伪造模型归因旨在通过识别生成给定音频样本的源模型来缓解合成语音的滥用,从而实现问责制度并为供应商提供信息。该任务具有挑战性,但基于自监督学习 (SSL) 的声学特征已显示出领先的归因能力,然而其成功的背后因素以及其判别力的局限性仍不清晰。本文我们系统性地调查 SSL 提取的特征如何捕获音频深度伪造中的架构签名。通过控制音频生成过程的多个维度,我们揭示了模型检查点、文本提示、声码器或说话人身份等细微扰动如何影响归因。我们的结果为 SSL 基于深度伪造归因的鲁棒性、偏差和局限性提供了新见解,突显了其在现实场景中的优势与脆弱性。

关键词

引用

@article{arxiv.2603.13488,
  title  = {Understanding the strengths and weaknesses of SSL models for audio deepfake model attribution},
  author = {Gabriel Pîrlogeanu and Adriana Stan and Horia Cucu},
  journal= {arXiv preprint arXiv:2603.13488},
  year   = {2026}
}

备注

Accepted for publication at ICASSP 2026