中文

基于分数融合的ADD挑战赛3.2赛道深度伪造检测系统

音频与语音处理 2022-10-14 v1 声音

摘要

本文描述了提交至音频深度合成检测(ADD)挑战赛3.2赛道的深度伪造音频检测系统,并给出分数融合的分析。所提系统为多个基于轻量卷积神经网络(LCNN)模型的分数级融合。使用多种前端作为输入特征,包括低频短时傅里叶变换与Constant Q变换。由于复杂噪声与丰富合成算法,直接使用训练集难以获得期望性能。在线数据增强方法有效提升伪造音频检测系统鲁棒性。特别地,通过分数分布可视化及与另一数据集上分数分布比较,探究了分数融合改进甚微的原因。模型对训练集的过拟合导致分数极值与分数分布低相关性,使分数融合困难。与部分伪造音频检测系统融合进一步提升了系统性能。在3.2赛道上的提交取得了11.04%的加权等错误率(WEER),是该挑战赛中表现最佳的系统之一。

关键词

引用

@article{arxiv.2210.06818,
  title  = {Deepfake Detection System for the ADD Challenge Track 3.2 Based on Score Fusion},
  author = {Yuxiang Zhang and Jingze Lu and Xingming Wang and Zhuo Li and Runqiu Xiao and Wenchao Wang and Ming Li and Pengyuan Zhang},
  journal= {arXiv preprint arXiv:2210.06818},
  year   = {2022}
}

备注

Accepted by ACM Multimedia 2022 Workshop: First International Workshop on Deepfake Detection for Audio Multimedia