中文

面向音频深度伪造检测的量子核特征图

声音 2026-05-08 v1 人工智能

摘要

量子机器学习已成为模式识别的有前景的工具,但许多面向音频的研究方法仍将 spectrogram 视为通用图像,未充分利用其时频结构。我们提出 Q-Patch,一种针对音频的量子特征映射,通过浅层硬件高效电路运用邻接感知纠缠,将 mel-spectrogram 中的局部时频 patch 编码为量子态。每个选取的 patch 由简约的四维声学描述符概括,并映射到四量子比特电路,深度最多为三,从而在近期约束下实现实用的量子核构建。我们在受控、平衡的协议下,对 Q-Patch 在音频欺骗检测任务中进行评估,并与规模匹配的经典基线进行比较。Q-Patch 在真实样本与伪造样本之间的判别能力提升,实现了受试者工作特征曲线下面积(AUROC)为 0.87,而与 RBF-SVM 在相同 patch 级特征上训练得到的为 0.82。核空间分析进一步显示出清晰的类别结构,跨类相似性约为 0.615,类内自相似性为 1.00。总体而言,Q-Patch 提供了一种实用的框架,将时频感知表示纳入量子核学习,用于低资源环境下的音频真实性评估。

关键词

引用

@article{arxiv.2605.06035,
  title  = {Quantum Kernels for Audio Deepfake Detection Using Spectrogram Patch Features},
  author = {Lisan Al Amin and Rakib Hossain and Mahbubul Islam and Faisal Quader and Thanh Thi Nguyen},
  journal= {arXiv preprint arXiv:2605.06035},
  year   = {2026}
}