中文

基于谱相关密度的循环统计分析用于语音深度伪造检测

音频与语音处理 2026-03-05 v1

摘要

语音深度伪造检测(SDD)对于维持语音驱动技术和数字媒体的信任至关重要。尽管近期的 SDD 系统越来越依赖自监督学习(SSL)表示,这些表示捕获丰富的上下文信息,但来自信号驱动的声学特征对于建模语音的细粒度结构属性仍然重要。大多数现有声学前端基于时频表示,这些表示未充分利用语音信号固有的更高阶谱依赖。我们提出一种基于谱相关密度(SCD)的循环统计感知声学特征提取框架,用于 SDD。该方法的特征模型化语音中周期性统计结构,通过捕捉频率分量之间的谱相关来实现。具体而言,我们提出时序结构化的 SCD 特征,用于表征谱和循环频率分量随时间的演变。通过多种对抗措施架构评估所提特征的有效性和互补性,包括卷积神经网络、SSL 嵌入系统和混合融合模型。在 ASVspoof 2019 LA、ASVspoof 2021 DF 和 ASVspoof 5 数据集上进行实验,表明 SCD 基于特征为 SSL 嵌入和常规声学表示提供互补的判别信息。特别是,融合 SSL 和 SCD 嵌入可将 ASVspoof 2019 LA 上等误差率从 8.28% 降至 0.98%,并在具有挑战性的 ASVspoof 5 数据集上实现持续改进。结果凸显了循环统计信号分析作为语音深度伪造检测的理论依据且有效的前端。

引用

@article{arxiv.2603.03921,
  title  = {Cyclostationarity Analysis as a Complement to Self-Supervised Representations for Speech Deepfake Detection},
  author = {Cemal Hanilçi and Md Sahidullah and Tomi Kinnunen},
  journal= {arXiv preprint arXiv:2603.03921},
  year   = {2026}
}

备注

submitted to IEEE Transactions on Audio, Speech and Language Processing