中文

用于音频深度伪造检测的 WavLM 模型集成

音频与语音处理 2024-08-15 v1

摘要

音频深度伪造检测在过去几年中已成为一项关键任务,因为许多最新的语音合成和声音克隆系统能够生成高度逼真的语音样本,从而使其可用于恶意活动。在本文中,我们处理了 ASVspoof5 挑战赛中设定的音频深度伪造检测问题。首先,我们对十种预训练表示进行了基准测试,并表明源自 wav2vec2 和 wavLM 系列的自监督表示表现最佳。在这两者中,当按照挑战规则将预训练数据限制在 LibriSpeech 时,wavLM 表现更好。为了进一步提高性能,我们针对深度伪造检测任务对 wavLM 模型进行了微调。我们用来自其他深度伪造检测数据集的样本扩展了 ASVspoof5 数据集,并应用了数据增强。我们最终的挑战提交方案由四个模型的后期融合组合而成,在两个评估集上分别实现了 6.56% 和 17.08% 的等错误率。

关键词

引用

@article{arxiv.2408.07414,
  title  = {WavLM model ensemble for audio deepfake detection},
  author = {David Combei and Adriana Stan and Dan Oneata and Horia Cucu},
  journal= {arXiv preprint arXiv:2408.07414},
  year   = {2024}
}

备注

Accepted at ASVspoof Workshop 2024