中文

基于区域的持续学习优化用于音频深度伪造检测

声音 2024-12-17 v1 人工智能 音频与语音处理

摘要

语音合成和语音转换的快速发展带来了便利,但也带来了新的安全风险,迫切需要有效的音频深度伪造检测。尽管当前模型表现良好,但当面对真实世界深度伪造的多样性和演化性时,其有效性会降低。为了解决这个问题,我们提出了一种名为基于区域优化(RegO)的持续学习方法用于音频深度伪造检测。具体来说,我们使用Fisher信息矩阵来测量真实和伪造音频检测的重要神经元区域,将其划分为四个区域。首先,我们直接微调较不重要的区域以快速适应新任务。接下来,我们对仅对真实音频检测重要的区域应用并行梯度优化,对仅对伪造音频检测重要的区域应用正交方向梯度优化。对于两者都重要的区域,我们使用基于样本比例的自适应梯度优化。这种区域自适应优化确保了记忆稳定性和学习可塑性之间的适当权衡。此外,为了解决旧任务中冗余神经元的增加,我们进一步引入艾宾浩斯遗忘机制来释放它们,从而促进模型学习更通用的判别特征。实验结果表明,我们的方法在音频深度伪造检测的EER上比最先进的持续学习方法RWM提高了21.3%。此外,RegO的有效性超出了音频深度伪造检测领域,在其他任务(如图像识别)中显示出潜在意义。代码可在https://github.com/cyjie429/RegO获取。

关键词

引用

@article{arxiv.2412.11551,
  title  = {Region-Based Optimization in Continual Learning for Audio Deepfake Detection},
  author = {Yujie Chen and Jiangyan Yi and Cunhang Fan and Jianhua Tao and Yong Ren and Siding Zeng and Chu Yuan Zhang and Xinrui Yan and Hao Gu and Jun Xue and Chenglong Wang and Zhao Lv and Xiaohui Zhang},
  journal= {arXiv preprint arXiv:2412.11551},
  year   = {2024}
}

备注

Accepted by AAAI 2025