紧凑型自监督学习主干网络是否影响音频深度伪造检测?基于RAPTOR的受控研究
声音
2026-03-09 v1 人工智能
计算与语言
摘要
自监督学习(SSL)是现代音频深度伪造检测的基础,然而大多数前期工作仅关注单一的大规模wav2vec2-XLSR主干网络,紧凑型模型鲜有研究。本文提出RAPTOR(Representation Aware Pairwise-gated Transformer for Out-of-domain Recognition),这是一种受控的紧凑型SSL主干网络研究框架,集成HuBERT和WavLM等主干网络,基于统一的两两加权融合检测器,在14个跨域基准上进行评估。我们表明,多语言HuBERT预训练是跨域鲁棐性的主要驱动力,使100M规模的模型能够匹配更大规模的商业系统。除EER指标外,本文引入一种基于扰动的测试时数据增强协议,以测度卡尔曼不确定性,揭示标准指标无法暴露的校准差异:WavLM变体在扰动下表现出过度自信的误校准,而迭代式mHuBERT保持稳定。这些发现表明,SSL预训练轨迹而非模型规模,是可靠音频深度伪造检测的关键因素。
引用
@article{arxiv.2603.06164,
title = {Do Compact SSL Backbones Matter for Audio Deepfake Detection? A Controlled Study with RAPTOR},
author = {Ajinkya Kulkarni and Sandipana Dowerah and Atharva Kulkarni and Tanel Alumäe and Mathew Magimai Doss},
journal= {arXiv preprint arXiv:2603.06164},
year = {2026}
}
备注
Submitted to Interspeech 2026, 4 pages, 2 figures