中文

基于量子核 SVM 的可变条件下可靠音频深度伪造检测

声音 2025-12-23 v1 人工智能

摘要

在标签稀缺且录音条件变化的情况下检测合成语音具有挑战性。现有的端到端深度模型容易过拟合或难以泛化,而虽然核方法在竞争中仍可保持,但其性能高度依赖于所选核函数。我们表明,使用量子核函数可在不增加模型规模的情况下降低误报率。量子特征图将数据嵌入高维希尔伯特空间, enables 使用表达性相似性度量和紧凑分类器。建立在此动机基础上,我们在四个语料库(ASVspoof 2019 LA、ASVspoof 5 (2024)、ADD23 以及野生集)上进行 5 折交叉验证,使用相同的 mel 频谱图预处理和分层抽样,对 QSVM 与经典 SVM进行比较。QSVM 在 ASVspoof 5 (2024) 上实现的等错误率(EER)为 0.183,而经典 SVM 为 0.299;在 ADD23 上为 0.081 与 0.188;在 ASVspoof 2019 上为 0.346 与 0.399;野生集上为 0.355 与 0.413。在 EER 运行点(即 FPR 等于 FNR)处,这分别对应着 0.116(38.8%)、0.107(56.9%)、0.053(13.3%)和 0.058(14.0%)的绝对误报率降低。我们还报告了跨交叉验证折叠和基于边际的类间分离度量中结果的一致性,两者的设置相同,唯一的区别是核函数;特征和 SVM 保持不变,未引入额外的可训练参数,量子核函数是在常规计算机上计算的。

关键词

引用

@article{arxiv.2512.18797,
  title  = {Reliable Audio Deepfake Detection in Variable Conditions via Quantum-Kernel SVMs},
  author = {Lisan Al Amin and Vandana P. Janeja},
  journal= {arXiv preprint arXiv:2512.18797},
  year   = {2025}
}

备注

This paper is accepted in ICDM 2025-MLC workshop