中文

解决数据增强训练中用于鲁棒语音深度伪造检测的梯度不一致问题

声音 2026-01-29 v2 人工智能

摘要

在语音深度伪造检测(SDD)中,数据增强(DA)常用于提高模型在不同语音条件和欺骗攻击下的泛化能力。然而,在训练过程中,来自原始输入和增强输入的反传梯度可能不一致,从而导致冲突的参数更新。这些冲突可能阻碍收敛并将模型推向次优解,从而降低数据增强的收益。为了研究并解决这一问题,我们设计了一种双路径数据增强(DPDA)训练框架,并引入梯度对齐机制。在我们的框架中,每个训练语音通过两条输入路径处理:一条使用原始语音,另一条使用其增强版本。这种设计使我们能够比较并对齐它们的反传梯度方向,以减少优化冲突。我们的分析表明,在使用 RawBoost 增强时,约 25% 的训练迭代在原始输入与其增强对应项之间存在梯度冲突。通过梯度对齐解决这些冲突后,我们的方法通过减少训练轮次加速了收敛,并在 In-the-Wild 数据集上相比基线方法实现了高达 18.69% 的相对等错误率降低。

关键词

引用

@article{arxiv.2509.20682,
  title  = {Addressing Gradient Misalignment in Data-Augmented Training for Robust Speech Deepfake Detection},
  author = {Duc-Tuan Truong and Tianchi Liu and Junjie Li and Ruijie Tao and Kong Aik Lee and Eng Siong Chng},
  journal= {arXiv preprint arXiv:2509.20682},
  year   = {2026}
}

备注

Accepted by ICASSP 2026