基于 Whisper 编码的演唱声音深度伪造检测
声音
2025-02-03 v1 人工智能
音频与语音处理
摘要
演唱声音的深度伪造生成是音乐行业艺术家的一个令人担忧的问题。本文提出一种唱作声音深度伪造检测(SVDD)系统,该系统使用开放AI的Whisper模型的噪声变异编码。尽管Whisper模型已知具有噪声鲁棒性,但编码包含丰富的非语音信息,并且是噪声变异的。这导致我们将Whisper编码作为SVDD任务的特征表示进行评估。因此,本文在人声和混合信号上执行SVDD任务,并在不同Whisper模型规模和两种分类器-CNN和ResNet34的条件下进行评估。
引用
@article{arxiv.2501.18919,
title = {Deepfake Detection of Singing Voices With Whisper Encodings},
author = {Falguni Sharma and Priyanka Gupta},
journal= {arXiv preprint arXiv:2501.18919},
year = {2025}
}
备注
Accepted in ICASSP,2025