利用Whisper特征改进DeepFake检测
声音
2023-06-05 v1 机器学习
音频与语音处理
摘要
随着近期语音生成方法的涌入,音频DeepFake(DF)带来的威胁日益增加。已有若干不同的检测方法作为对策被提出。许多方法基于所谓的前端(front-end),其通过对原始音频进行变换,凸显对评估音频样本真实性至关重要的特征。我们的贡献在于研究最先进的Whisper自动语音识别模型作为DF检测前端的影响。我们在广泛使用的ASVspoof 2021 DF数据集上训练了3种检测模型(LCNN、SpecRNet和MesoNet),随后在DF In-The-Wild数据集上评估,比较了Whisper与成熟前端的多种组合。我们表明,使用基于Whisper的特征改善了各模型的检测效果,并在In-The-Wild数据集上通过降低21%的等错误率(Equal Error Rate)优于近期结果。
引用
@article{arxiv.2306.01428,
title = {Improved DeepFake Detection Using Whisper Features},
author = {Piotr Kawa and Marcin Plata and Michał Czuba and Piotr Szymański and Piotr Syga},
journal= {arXiv preprint arXiv:2306.01428},
year = {2023}
}
备注
Accepted to INTERSPEECH 2023