从零-shot 到零谎言:基于迁移学习检测孟加拉深伪造音频
声音
2025-12-29 v1 人工智能
摘要
语音合成和语音转换系统的快速增长使深度伪造音频成为重大安全挑战。孟加拉语深度伪造检测研究尚未得到充分关注。本文研究了使用 BanglaFake 数据集自动检测孟加拉语深度伪造音频的方法。我们评估了几种预训练模型的零样推断,包括 Wav2Vec2-XLSR-53、Whisper、PANNsCNN14、WavLM 和 Audio Spectrogram Transformer。零样本结果显示检测能力有限。效果最好的模型是 Wav2Vec2-XLSR-53,准确率为 53.80%,AUC 为 56.60%,EER 为 46.20%。随后我们对多种架构进行微调,以进行孟加拉语深度伪造检测,包括 Wav2Vec2-Base、LCNN、LCNN-Attention、ResNet18、ViT-B16 和 CNN-BiLSTM。微调后模型显示出显著的性能提升。ResNet18 实现最高的准确率为 79.17%,F1 分数为 79.12%,AUC 为 84.37%,EER 为 24.35%。实验结果确认,微调显著优于零样本推断。本研究为孟加拉语深度伪造音频检测提供了首个系统性基准,突显了针对该低资源语言使用微调深度学习模型的有效性。
引用
@article{arxiv.2512.21702,
title = {Zero-Shot to Zero-Lies: Detecting Bengali Deepfake Audio through Transfer Learning},
author = {Most. Sharmin Sultana Samu and Md. Rakibul Islam and Md. Zahid Hossain and Md. Kamrozzaman Bhuiyan and Farhad Uz Zaman},
journal= {arXiv preprint arXiv:2512.21702},
year = {2025}
}
备注
Accepted for publication in 2025 28th International Conference on Computer and Information Technology (ICCIT)