中文

基于 Whisper 编码的演唱声音深度伪造检测

声音 2025-02-03 v1 人工智能 音频与语音处理

摘要

演唱声音的深度伪造生成是音乐行业艺术家的一个令人担忧的问题。本文提出一种唱作声音深度伪造检测(SVDD)系统,该系统使用开放AI的Whisper模型的噪声变异编码。尽管Whisper模型已知具有噪声鲁棒性,但编码包含丰富的非语音信息,并且是噪声变异的。这导致我们将Whisper编码作为SVDD任务的特征表示进行评估。因此,本文在人声和混合信号上执行SVDD任务,并在不同Whisper模型规模和两种分类器-CNN和ResNet34的条件下进行评估。

关键词

引用

@article{arxiv.2501.18919,
  title  = {Deepfake Detection of Singing Voices With Whisper Encodings},
  author = {Falguni Sharma and Priyanka Gupta},
  journal= {arXiv preprint arXiv:2501.18919},
  year   = {2025}
}

备注

Accepted in ICASSP,2025