面向音频深度伪造检测的 SSL 模型逐层综合分析
音频与语音处理
2025-02-10 v2 声音
摘要
本文对用于音频深度伪造检测的自监督学习 (SSL) 模型进行了全面的逐层分析,涵盖了多种上下文环境,包括多语言数据集(英语、中文、西班牙语)、部分、歌曲和基于场景的深度伪造场景。通过系统评估不同 Transformer 层的贡献,我们揭示了对模型行为和性能的关键见解。我们的发现表明,较低层始终提供最具判别力的特征,而较高层则捕获较少相关信息。值得注意的是,即使使用减少的层数,所有模型也能达到有竞争力的等错误率 (EER) 分数。这表明我们可以通过仅利用少数较低层来降低计算成本并提高检测深度伪造的推理速度。这项工作增进了我们对 SSL 模型在深度伪造检测中的理解,提供了适用于不同语言和上下文环境的宝贵见解。我们训练好的模型和代码已公开提供:https://github.com/Yaselley/SSL_Layerwise_Deepfake。
引用
@article{arxiv.2502.03559,
title = {Comprehensive Layer-wise Analysis of SSL Models for Audio Deepfake Detection},
author = {Yassine El Kheir and Youness Samih and Suraj Maharjan and Tim Polzehl and Sebastian Möller},
journal= {arXiv preprint arXiv:2502.03559},
year = {2025}
}
备注
Accepted to NAACL Findings 2025