受音频生成伪影启发的泛化欺骗检测
声音
2021-06-29 v2 密码学与安全
音频与语音处理
摘要
最先进的音频生成方法存在指纹伪影以及时间和频谱域上重复的 inconsistencies。此类伪影可通过频谱图上的频域分析很好地捕获。因此,我们提出一种新颖的长程谱-时调制特征——对数梅尔频谱图上的二维 DCT,用于音频深度伪造检测。我们表明,该特征优于对数梅尔频谱图、CQCC、MFCC,是捕获此类伪影的合适候选。我们采用频谱增强和特征归一化,以减少过拟合并缩小训练与测试数据集之间的差距,同时引入这一新特征。我们开发了一个基于 CNN 的基线,其 t-DCF 达到 0.0849,优于 ASVspoof 2019 挑战赛中先前报告的最佳单系统。最后,通过将我们的基线与所提出的二维 DCT 谱-时特征相结合,我们将 t-DCF 分数降低 14% 至 0.0737,使其成为最先进的欺骗检测系统。此外,我们使用两个外部数据集评估我们的模型,展示了所提特征的泛化能力。我们还对所提特征与结果提供了分析与消融研究。
引用
@article{arxiv.2104.04111,
title = {Generalized Spoofing Detection Inspired from Audio Generation Artifacts},
author = {Yang Gao and Tyler Vuong and Mahsa Elyasi and Gaurav Bharaj and Rita Singh},
journal= {arXiv preprint arXiv:2104.04111},
year = {2021}
}
备注
Camera ready version. Accepted by INTERSPEECH 2021