中文

当微调不足时:来自HSAD关于混合与对抗性音频欺骗检测的经验教训

声音 2025-09-10 v1 密码学与安全

摘要

人工智能的快速发展使得高度逼真的语音合成和声音克隆成为可能,对声纹认证、智能助手和电信安全构成严重风险。虽然大多数先前工作将欺骗检测视为二分类任务,但现实世界的攻击通常涉及混合真实与合成语音的混合话语,这使得检测更具挑战性。为填补这一空白,我们引入了混合欺骗音频数据集(HSAD),这是一个包含1,248条干净语音和41,044条退化语音的基准数据集,涵盖四个类别:人类、克隆、零样本AI生成和混合音频。每个样本都标注了欺骗方法、说话人身份和退化元数据,以便进行细粒度分析。我们评估了六个基于Transformer的模型,包括频谱图编码器(MIT-AST, MattyB95-AST)和自监督波形模型(Wav2Vec2, HuBERT)。结果揭示了关键教训:预训练模型过度泛化并在混合条件下崩溃;针对欺骗的微调提高了可分离性,但难以应对未见过的组合;在HSAD上进行数据集特定适配带来了巨大的性能提升(AST准确率大于97%,F1分数约99%),尽管对于复杂混合音频仍存在残余错误。这些发现表明,仅靠微调是不够的——像HSAD这样稳健的混合感知基准对于暴露校准失败、模型偏差以及在对抗环境中影响欺骗检测的因素至关重要。因此,HSAD为构建具有弹性和可信赖的声纹认证系统提供了数据集和分析框架。

关键词

引用

@article{arxiv.2509.07323,
  title  = {When Fine-Tuning is Not Enough: Lessons from HSAD on Hybrid and Adversarial Audio Spoof Detection},
  author = {Bin Hu and Kunyang Huang and Daehan Kwak and Meng Xu and Kuan Huang},
  journal= {arXiv preprint arXiv:2509.07323},
  year   = {2025}
}

备注

13 pages, 11 figures.This work has been submitted to the IEEE for possible publication