中文

BreathNet:基于呼吸线索的通用音频深度伪造检测

声音 2026-02-17 v1 音频与语音处理

摘要

随着深度伪造音频的真实性和多样性提升,开发通用对策系统变得至关重要。现有检测方法主要依赖XLS-R前端特征以提高泛化性,但其性能仍受限,部分原因在于对细粒度信息(如生理线索或频域特征)的关注不足。本文提出BreathNet,一种集成细粒度呼吸信息以提升泛化性的新型音频深度伪造检测框架。具体而言,我们设计BreathFiLM,一种基于呼吸声存在性的时序表示选择性放大特征的特征级线性调制机制。BreathFiLM与XLS-R提取器联合训练,鼓励提取器学习并编码呼吸相关线索到时序特征中。随后,我们使用频率前端提取谱系特征,将其与时序特征融合,以提供由声码器或压缩伪造引入的互补信息。此外,我们提出一组特征损失,包括正面监督对比损失(PSCL)、中心损失和对比损失,这些损失共同增强判别能力,鼓励模型在特征空间中更有效地分离真实样本和深度伪造样本。广泛实验表明,BreathNet在五个基准数据集上实现了状态的最佳性能。在使用ASVspoof 2019 LA训练集时,本方法在四个相关评估基准上的平均EER为1.99%,在野外数据集上表现尤为突出,达4.70%。在ASVspoof5评估协议下,本方法在最新基准上的EER为4.94%。

关键词

引用

@article{arxiv.2602.13596,
  title  = {BreathNet: Generalizable Audio Deepfake Detection via Breath-Cue-Guided Feature Refinement},
  author = {Zhe Ye and Xiangui Kang and Jiayi He and Chengxin Chen and Wei Zhu and Kai Wu and Yin Yang and Jiwu Huang},
  journal= {arXiv preprint arXiv:2602.13596},
  year   = {2026}
}

备注

Under Review