监督对比学习中的相似性选择与负面缩放:用于深度伪造音频检测
音频与语音处理
2026-04-30 v1 机器学习
摘要
监督对比学习(SupCon)在塑造表示方面被广泛使用,但在音频深度伪造检测领域的针对性研究仍有限。现有工作通常将对比项与更广泛的管线组合;然而,对 SupCon 本身的关注缺失。在本工作中,我们对 wav2vec2 XLS-R(300M)进行受控研究,变更(i)SupCon 中的相似性(余弦相似性 vs 来自球面角度的角度相似性)以及(ii)负面缩放(使用温度启动的全局跨批队)。阶段 1 用 SupCon 微调编码器和投影头;阶段 2 冻结它们并用 BCE 训练线性分类器。在 ASVspoof 2019 LA 上训练,评估于 ASV19 eval 加上 ITW 和 ASVspoof 2021 DF/LA,余弦 SupCon 带延迟队列在 ITW EER(8.29%)和 pooled EER(4.44)上取得最佳成绩,而角度相似性在无队列负样本时表现强劲(ITW 8.70),表明其对大型负样本集合的依赖较低。
引用
@article{arxiv.2604.26057,
title = {Similarity Choice and Negative Scaling in Supervised Contrastive Learning for Deepfake Audio Detection},
author = {Jaskirat Sudan and Hashim Ali and Surya Subramani and Hafiz Malik},
journal= {arXiv preprint arXiv:2604.26057},
year = {2026}
}