中文

WaveSP-Net:面向语音深度伪造检测的可学习小波域稀疏提示调谐

音频与语音处理 2026-01-29 v2 计算与语言 信号处理

摘要

现代语音深度伪造检测的前端设计依赖于对大型预训练模型如 XLSR 的完全微调。然而,这种方法在参数效率方面不足,可能导致对现实中野生数据类型的泛化性能不佳。为克服这些限制,我们提出一种新的参数高效前端,融合提示调谐与经典信号处理变换,包括基于傅里叶变换的 FourierPT-XLSR,以及基于小波变换的两种变体:WSPT-XLSR 和 Partial-WSPT-XLSR。我们进一步提出 WaveSP-Net,一种新型体系结构,将 Partial-WSPT-XLSR 前端与双向 Mamba 后端相结合。该设计将多分辨率特征注入提示嵌入中,增强了对细微合成伪影的局部化,而无需修改冻结的 XLSR 参数。实验结果表明,WaveSP-Net 在两个新且具有挑战性的基准测试 Deepfake-Eval-2024 和 SpoofCeleb 上超越了多个最先进模型,参数可训练性低且性能显著提升。代码和模型已提供于 https://github.com/xxuan-acoustics/WaveSP-Net。

关键词

引用

@article{arxiv.2510.05305,
  title  = {WaveSP-Net: Learnable Wavelet-Domain Sparse Prompt Tuning for Speech Deepfake Detection},
  author = {Xi Xuan and Xuechen Liu and Wenxin Zhang and Yi-Cheng Lin and Xiaojian Lin and Tomi Kinnunen},
  journal= {arXiv preprint arXiv:2510.05305},
  year   = {2026}
}

备注

Accepted at ICASSP 2026