检测全类型深度伪造音频:基于小波提示调优的听觉感知增强
声音
2026-01-12 v2 人工智能
摘要
音频生成技术的快速发展加剧了跨语种、音效、歌声和音乐的深度伪造音频风险,威胁着多媒体安全与信任。虽然现有反措施(CMs)在单类型音频深度伪造检测(ADD)中表现良好,但在跨类型场景下性能下降。本文致力于研究全类型 ADD 任务。我们首次系统构建了全类型 ADD 基准,涵盖语种、音效、歌声和音乐的跨类型深度伪造检测。随后,我们引入提示调优自监督学习(PT-SSL)训练范式,通过学习针对 ADD 的专用提示标记优化 SSL 前端,训练参数比微调(FT)少 458 倍。考虑到不同音频类型的听觉感知,我们提出小波提示调优(WPT)SSL 方法,从频域捕获类型不变的听觉深度伪造信息,而无需额外训练参数,从而在全类型 ADD 任务中超越 FT。为实现通用 CM,我们利用所有类型的深度伪造音频进行联合训练。实验结果表明,WPT-XLSR-AASIST 在所有评估数据集上实现最佳表现,平均 EER 为 3.58%。
引用
@article{arxiv.2504.06753,
title = {Detect All-Type Deepfake Audio: Wavelet Prompt Tuning for Enhanced Auditory Perception},
author = {Yuankun Xie and Ruibo Fu and Zhiyong Wang and Xiaopeng Wang and Songjun Cao and Long Ma and Haonan Cheng and Long Ye},
journal= {arXiv preprint arXiv:2504.06753},
year = {2026}
}
备注
Accepted to AAAI 2026