中文

基于掩码自编码器的真声聚焦学习用于通用伪造音频检测

声音 2024-06-11 v2 音频与语音处理

摘要

由于新的欺骗技术的出现,伪造音频检测(FAD)的泛化能力至关重要。传统的FAD方法通常仅专注于区分真实音频和已知的欺骗音频。我们提出了一个由真声聚焦学习(GFL)框架引导的方法,旨在实现高度泛化的FAD,称为GFL-FAD。该方法结合了一个基于掩码自编码器(MAE)架构进行音频重建的反事实推理增强表示(CRER),以精确建模真实音频特征。为了减少训练过程中欺骗音频的影响,我们引入了一个真实音频重建损失,保持对学习真实数据特征的关注。此外,从MAE中提取与内容相关的瓶颈(BN)特征,以补充原始音频的知识。这些BN特征与CRER自适应融合,以进一步提高鲁棒性。我们的方法在ASVspoof2019 LA数据集上实现了最先进的性能,等错误率(EER)为0.25%。

关键词

引用

@article{arxiv.2406.03247,
  title  = {Genuine-Focused Learning using Mask AutoEncoder for Generalized Fake Audio Detection},
  author = {Xiaopeng Wang and Ruibo Fu and Zhengqi Wen and Zhiyong Wang and Yuankun Xie and Yukun Liu and Jianhua Tao and Xuefei Liu and Yongwei Li and Xin Qi and Yi Lu and Shuchen Shi},
  journal= {arXiv preprint arXiv:2406.03247},
  year   = {2024}
}

备注

Accepted by INTERSPEECH 2024