中文

面向语音深度伪造检测的量化感知层次神经编解码器模型

声音 2026-03-19 v1 人工智能 计算与语言 音频与语音处理

摘要

神经音频编解码器通过残差向量量化(RVQ)离散化语音,形成编解码器级别间的粗到细层次结构。虽然编解码器模型已用于表征学习,但其离散结构在语音深度伪造检测中仍被 underutilize。具体而言,不同的量化层次捕捉互补的声学线索,其中早期编解码器编码粗糙结构,后期编解码器细化残差细节以揭示合成痕迹。现有系统要么依赖连续编码器特征,要么忽视编解码器级别的层次结构。我们提出一种层次感知表征学习框架,通过可学习的全局加权建模编解码器级别的贡献,实现与法医线索对齐的结构化编解码器表征。保持语音编码器主干冻结,仅更新4.4%的额外参数,我们的方法在ASVspoof 2019和ASVspoof5上分别实现了46.2%和13.9%的相对EER降低。

关键词

引用

@article{arxiv.2603.16914,
  title  = {Quantizer-Aware Hierarchical Neural Codec Modeling for Speech Deepfake Detection},
  author = {Jinyang Wu and Zihan Pan and Qiquan Zhang and Sailor Hardik Bhupendra and Soumik Mondal},
  journal= {arXiv preprint arXiv:2603.16914},
  year   = {2026}
}

备注

5 pages, 3 figures