中文

CompSpoof:面向组件级音频防欺骗的基准数据集与联合学习框架

声音 2026-02-02 v2 音频与语音处理

摘要

组件级音频欺骗 (Comp-Spoof) 针对一种新型音频操纵方式,即仅针对信号的特定组成部分(如语音或环境声)进行伪造或替换,而其他部分保持真实。现有防欺骗数据集与方法将整个 utterance 或片段视为全真或全伪造,无法准确检测组件级欺骗。为此,我们构建了覆盖多种真实与伪造语音及环境声组合的 CompSpoof 数据集。进一步提出一种分离增强的联合学习框架,对音频组成部分进行分离处理,并对每个组成部分应用防欺骗模型。采用联合学习以保留检测所需信息。大量实验表明,我们的方法优于基线方法,凸显独立组件和按组件分别检测欺骗的必要性。数据集与代码已公开于 https://github.com/XuepingZhang/CompSpoof。

关键词

引用

@article{arxiv.2509.15804,
  title  = {CompSpoof: A Dataset and Joint Learning Framework for Component-Level Audio Anti-spoofing Countermeasures},
  author = {Xueping Zhang and Yechen Wang and Linxi Li and Liwei Jin and Ming Li},
  journal= {arXiv preprint arXiv:2509.15804},
  year   = {2026}
}

备注

accepted at ICASSP 2026