中文

面向可泛化且校准的合成语音检测:基于自监督表征的方法

音频与语音处理 2024-06-14 v2 声音

摘要

泛化——模型在未见数据上表现良好的能力——对于构建可靠的深度伪造检测器至关重要。然而,近期研究表明当前的音频深度伪造模型未达到这一要求。在本工作中,我们研究预训练自监督表征在构建通用且校准的音频深度伪造检测模型方面的潜力。我们表明,大型冻结表征 coupled with 一个简单的逻辑回归分类器在实现强泛化能力方面极为有效:与 RawNet2 模型相比,该方法在八个深度伪造数据集的基准上将等错误率从 30.9% 降低到 8.8%,同时学习的参数少于 2k。此外,与先前方法相比,所提方法产生更可靠的预测,使其更适合实际运用。

关键词

引用

@article{arxiv.2309.05384,
  title  = {Towards generalisable and calibrated synthetic speech detection with self-supervised representations},
  author = {Octavian Pascu and Adriana Stan and Dan Oneata and Elisabeta Oneata and Horia Cucu},
  journal= {arXiv preprint arXiv:2309.05384},
  year   = {2024}
}

备注

Accepted at Interspeech 2024