基于深度稳定学习的广义伪造音频检测
声音
2024-06-06 v1 音频与语音处理
摘要
尽管当前的伪造音频检测方法在特定数据集上取得了显著成功,但在评估来自不同分布的数据集时,它们常常失败。先前的研究通常通过使用额外数据或在训练过程中施加额外损失约束来处理分布偏移。然而,这些方法要么需要大量数据,要么使训练过程复杂化。在这项工作中,我们提出了一种基于稳定学习的训练方案,该方案包含一个样本权重学习(SWL)模块,通过学习训练样本的权重来去相关所有选定特征,从而解决分布偏移问题。所提出的便携式插件式SWL易于应用于多个基础模型,并在训练过程中无需使用额外数据即可对其进行泛化。在ASVspoof数据集上进行的实验清楚地证明了SWL在跨三个不同分布的评估数据集上泛化不同模型的有效性。
引用
@article{arxiv.2406.03237,
title = {Generalized Fake Audio Detection via Deep Stable Learning},
author = {Zhiyong Wang and Ruibo Fu and Zhengqi Wen and Yuankun Xie and Yukun Liu and Xiaopeng Wang and Xuefei Liu and Yongwei Li and Jianhua Tao and Yi Lu and Xin Qi and Shuchen Shi},
journal= {arXiv preprint arXiv:2406.03237},
year = {2024}
}
备注
accepted by INTERSPEECH2024