中文

基于高斯过程的少样本语音深度伪造检测自适应

声音 2025-05-30 v1 机器学习 音频与语音处理

摘要

文本到语音(TTS)模型的最新进展,特别是在语音克隆方面,加剧了对可适应且高效的深度伪造检测方法的需求。随着TTS系统不断演进,检测模型必须能够以最少的数据高效适应以前未见过的生成模型。本文提出了ADD-GP,一种基于高斯过程(GP)分类器的少样本自适应框架,用于音频深度伪造检测(ADD)。我们展示了强大的深度嵌入模型与高斯过程灵活性的结合如何实现强大的性能和适应性。此外,我们表明该方法也可用于个性化检测,对新的TTS模型具有更强的鲁棒性并具备单样本适应性。为了支持我们的评估,使用新的最先进的语音克隆模型为该任务构建了一个基准数据集。

关键词

引用

@article{arxiv.2505.23619,
  title  = {Few-Shot Speech Deepfake Detection Adaptation with Gaussian Processes},
  author = {Neta Glazer and David Chernin and Idan Achituve and Sharon Gannot and Ethan Fetaya},
  journal= {arXiv preprint arXiv:2505.23619},
  year   = {2025}
}