中文

探索绿色AI用于音频深度伪造检测

声音 2024-03-22 v1 计算机视觉与模式识别 机器学习 音频与语音处理

摘要

利用深度神经网络的最先进音频深度伪造检测器展现出令人印象深刻的识别性能。然而,这一优势伴随着显著的碳足迹。这主要是由于使用带有加速器的高性能计算和较长的训练时间。研究表明,平均深度NLP模型产生约626k磅的CO\textsubscript{2},相当于美国汽车平均终生排放量的五倍。这无疑对环境构成了巨大威胁。为应对这一挑战,本研究提出了一种新颖的音频深度伪造检测框架,该框架可以使用标准CPU资源无缝训练。我们提出的框架利用现成的基于自监督学习(SSL)的模型,这些模型已预训练并可在公共存储库中获取。与现有方法微调SSL模型并为下游任务采用额外深度神经网络不同,我们利用预训练模型提取的SSL嵌入,使用经典机器学习算法,如逻辑回归和浅层神经网络。我们的方法显示出与常用的高碳足迹方法相比具有竞争力的结果。在使用ASVspoof 2019 LA数据集的实验中,我们以不到1k的可训练模型参数实现了0.90%的等错误率(EER)。为鼓励该方向的进一步研究并支持可重复的结果,Python代码将在接收后公开发布。GitHub: https://github.com/sahasubhajit/Speech-Spoofing-

关键词

引用

@article{arxiv.2403.14290,
  title  = {Exploring Green AI for Audio Deepfake Detection},
  author = {Subhajit Saha and Md Sahidullah and Swagatam Das},
  journal= {arXiv preprint arXiv:2403.14290},
  year   = {2024}
}

备注

This manuscript is under review in a conference