中文

量子视觉理论用于深度伪造语音检测的音频分类

计算与语言 2026-04-10 v1

摘要

我们提出将量子视觉(QV)理论应用于深度学习基于音频的分类,用于深度伪造语音检测。受量子物理中粒子-波粒二象性的启发,QV理论基于这样一种想法:数据不仅可以以可观测的、坍缩后的形式表示,也可以作为信息波表示。在传统深度学习中,模型直接训练于这些坍缩后的表示形式,例如图像。在QV理论中,输入首先通过QV模块转换为信息波,然后输入深度学习模型进行分类。QV基于模型在图像分类方面的性能优于其非QV对手。那么,QV理论是否可以应用于语音频谱图进行音频分类任务呢?这就是本方法的动机与新颖性。本文中,将语音信号的短时傅里叶变换(STFT)、梅尔频谱图和梅尔频谱系数(MFCC)转换为信息波,使用提出的QV模块,然后用于训练基于QV的卷积神经网络(QV-CNN)和基于QV的视觉Transformer(QV-ViT)。在ASVSpoof数据集上进行了大量实验用于深度伪造语音分类。结果表明,QV-CNN和QV-ViT在区分真实语音和伪造语音方面 consistently优于标准CNN和ViT模型,实现更高的分类准确率并在鲁棒性方面取得改进。此外,使用MFCC特征的QV-CNN模型在ASVSpoof数据集上实现了最佳整体性能,准确率为94.20%,等效错误率(EER)为9.04%,而使用梅尔频谱图的QV-CNN模型实现了最高的准确率94.57%。这些发现表明,QV理论是深度伪造语音检测的有效且有前景的ethods,为量子启发式学习在音频感知任务中开辟了新的方向。

关键词

引用

@article{arxiv.2604.08104,
  title  = {Quantum Vision Theory Applied to Audio Classification for Deepfake Speech Detection},
  author = {Khalid Zaman and Melike Sah and Anuwat Chaiwongyenc and Cem Direkoglu},
  journal= {arXiv preprint arXiv:2604.08104},
  year   = {2026}
}