中文

基于帧级时序差学习的部分深度伪造语音检测

声音 2025-07-28 v1 密码学与安全 音频与语音处理

摘要

检测部分深度伪造语音至关重要,因为其可能用于轻微的虚假信息。然而,现有方法依赖于昂贵的帧级标注来进行训练,限制了实际应用的可扩展性。此外,这些方法关注检测bonafide语音片段与深度伪造片段之间的过渡痕迹。随着深度伪造生成技术日益平滑这些过渡,检测变得更加困难。为此,本工作提出了一种新的视角,通过分析帧级时序差异,揭示深度伪造语音在方向性变化和不自然的局部过渡方面表现出错乱,与bonafide语音不同。基于这一发现,我们提出了时序差注意力模块(TDAM),将部分深度伪造检测重新定义为识别不自然的时序变化,而无需依赖显式的边界标注。双层层次化差表示捕捉时序不规则性,既在细粒度层面又在粗粒度层面;而自适应平均池化则在可变长度输入上保留关键模式,以最小化信息损失。我们的TDAM-AvgPool模型在PartialSpoof数据集上实现了0.59%的等效错误率(EER),在HAD数据集上实现了0.03%,显著优于现有方法,且无需帧级监督。

关键词

引用

@article{arxiv.2507.15101,
  title  = {Frame-level Temporal Difference Learning for Partial Deepfake Speech Detection},
  author = {Menglu Li and Xiao-Ping Zhang and Lian Zhao},
  journal= {arXiv preprint arXiv:2507.15101},
  year   = {2025}
}

备注

5 pages, 4 figures, 4 tables. Accepted to IEEE SPL