中文

语音反欺骗中的数据增强研究

声音 2021-10-22 v1 密码学与安全 音频与语音处理

摘要

在本文中,我们深入研究了数据增强技术如何改善合成或伪造音频的检测。具体而言,我们提出了应对信道可变性、不同音频压缩、不同带宽以及未知欺骗攻击的方法,这些已被证明会显著劣化基于音频的系统与反欺骗系统的性能。我们的结果基于ASVspoof 2021挑战赛的逻辑访问(LA)与深度伪造(DF)类别。我们的研究是以数据为中心的,即模型固定,我们通过改变数据显著改进了结果。我们引入了两种数据增强形式——针对DF部分的压缩增强,以及针对LA部分的压缩与信道增强。此外,引入了一种新型在线数据增强SpecAverage,其中音频特征被其平均值掩蔽以改善泛化能力。进一步,我们引入了对数谱图特征设计以提升结果。我们最佳的单系统与融合方案在DF类别中均达到最先进性能,等错误率(EER)分别为15.46%与14.46%。我们用于LA任务的最佳系统将最佳基线EER降低了50%,最小t-DCF降低了16%。我们应对来自广泛分布的伪造数据的技术可被复现,并有助于反欺骗与基于语音的系统提升其效果。

关键词

引用

@article{arxiv.2110.10491,
  title  = {A Study On Data Augmentation In Voice Anti-Spoofing},
  author = {Ariel Cohen and Inbal Rimon and Eran Aflalo and Haim Permuter},
  journal= {arXiv preprint arXiv:2110.10491},
  year   = {2021}
}