基于分数融合的ADD挑战赛3.2赛道深度伪造检测系统
音频与语音处理
2022-10-14 v1 声音
摘要
本文描述了提交至音频深度合成检测(ADD)挑战赛3.2赛道的深度伪造音频检测系统,并给出分数融合的分析。所提系统为多个基于轻量卷积神经网络(LCNN)模型的分数级融合。使用多种前端作为输入特征,包括低频短时傅里叶变换与Constant Q变换。由于复杂噪声与丰富合成算法,直接使用训练集难以获得期望性能。在线数据增强方法有效提升伪造音频检测系统鲁棒性。特别地,通过分数分布可视化及与另一数据集上分数分布比较,探究了分数融合改进甚微的原因。模型对训练集的过拟合导致分数极值与分数分布低相关性,使分数融合困难。与部分伪造音频检测系统融合进一步提升了系统性能。在3.2赛道上的提交取得了11.04%的加权等错误率(WEER),是该挑战赛中表现最佳的系统之一。
引用
@article{arxiv.2210.06818,
title = {Deepfake Detection System for the ADD Challenge Track 3.2 Based on Score Fusion},
author = {Yuxiang Zhang and Jingze Lu and Xingming Wang and Zhuo Li and Runqiu Xiao and Wenchao Wang and Ming Li and Pengyuan Zhang},
journal= {arXiv preprint arXiv:2210.06818},
year = {2022}
}
备注
Accepted by ACM Multimedia 2022 Workshop: First International Workshop on Deepfake Detection for Audio Multimedia