中文

基于微调音频信号图变换器的混合 AI-人类语音检测

声音 2025-05-22 v1 密码学与安全 音频与语音处理

摘要

人工智能的快速发展使得高级音频生成和语音克隆技术成为可能,构成了依赖语音认证的应用面临重大安全风险。虽然现有数据集和模型主要聚焦于区分人类语音与完全合成语音,但现实攻击往往涉及混合了真实与克隆语音片段的音频。为填补这一空白,我们构建了一个新型混合音频数据集,包含人类语音、AI 生成语音、克隆语音以及混合语音样本。我们进一步提出基于微调音频信号图变换器(AST)的模型,用于检测这些复杂的声学特征。广泛的实验表明,我们的方法在混合音频检测方面显著优于现有基线,实现了97%的分类准确率。我们的发现凸显了混合数据集和定制模型在提升语音基于认证系统鲁健性方面的重要性。

关键词

引用

@article{arxiv.2505.15136,
  title  = {Hybrid Audio Detection Using Fine-Tuned Audio Spectrogram Transformers: A Dataset-Driven Evaluation of Mixed AI-Human Speech},
  author = {Kunyang Huang and Bin Hu},
  journal= {arXiv preprint arXiv:2505.15136},
  year   = {2025}
}

备注

11 pages, 6 figures