结合自监督 WavLM 与多融合注意力分类器的音频深度伪造检测
音频与语音处理
2024-01-11 v2
摘要
随着语音合成和语音转换技术的快速发展,音频深度伪造已成为自动说话人确认(ASV)系统的严重威胁。人们提出了许多对策来检测此类攻击。在本文中,我们报告了我们将自监督 WavLM 模型与多融合注意力分类器相结合用于音频深度伪造检测的努力。我们的方法首次利用 WavLM 模型来提取更有利于欺骗检测的特征。然后,我们提出了一种基于注意力统计池化(ASP)层的新颖多融合注意力(MFA)分类器。MFA 在时间和层级上捕获音频特征的互补信息。实验表明,我们的方法在 ASVspoof 2021 DF 数据集上取得了最先进的结果,并在 ASVspoof 2019 和 2021 LA 数据集上提供了有竞争力的结果。
引用
@article{arxiv.2312.08089,
title = {Audio Deepfake Detection with Self-Supervised WavLM and Multi-Fusion Attentive Classifier},
author = {Yinlin Guo and Haofan Huang and Xi Chen and He Zhao and Yuehai Wang},
journal= {arXiv preprint arXiv:2312.08089},
year = {2024}
}
备注
Accepted to ICASSP 2024. 5 pages, 1 figure