中文

ICLAD:用于音频深度伪造检测的基于比较指导的情境学习

声音 2026-04-21 v1 计算与语言 音频与语音处理

摘要

音频深度伪造构成重大的安全威胁,但当前的最先进(SOTA)检测系统对现实世界中的深度伪造泛化性差。我们引入一种 novel 情境学习范式,融合比较指导,用于音频深度伪造检测(ICLAD)。该框架使能利用音频语言模型(ALMs)对未见深度伪造实现训练自由的泛化,并提供检测结果的文本化解读。ICLAD的核心在于一种成对比较推理策略,引导ALMs发现并过滤幻觉及与深度伪造无关的声学属性。该ALMs与专用深度伪造检测器协同工作,其中一种路由机制将超出分布样本输送给ALMs。在野外数据集上,ICLAD在专用检测器的基础上将宏观F1分数提升了约2倍。进一步分析表明,ICLAD的灵活性及其在最新开源ALMs上的部署潜力。

关键词

引用

@article{arxiv.2604.16749,
  title  = {ICLAD: In-Context Learning with Comparison-Guidance for Audio Deepfake Detection},
  author = {Benjamin Chou and Yi Zhu and Surya Koppisetti},
  journal= {arXiv preprint arXiv:2604.16749},
  year   = {2026}
}

备注

To appear at ACL Findings 2026