中文

AT-ADD:全类型音频深度伪造检测挑战赛评估方案

声音 2026-04-10 v1 人工智能

摘要

音频大语言模型(ALLM)的快速发展使得对语音和非语音音频(包括音效、歌声和音乐)进行低成本、高保真的生成和操控成为可能。虽然这些能力促进了创造力和内容生产,但它们也引入了重大的安全和信任挑战,因为逼真的音频深度伪造现在可以大规模生成和传播。然而,现有的音频深度伪造检测(ADD)对策和基准在很大程度上仍然以语音为中心,通常依赖于语音特定的伪影,对现实世界失真的鲁棒性有限,并且对异构音频类型和新兴欺骗技术的泛化能力受限。为填补这些空白,我们为ACM Multimedia 2026提出了全类型音频深度伪造检测(AT-ADD)大挑战赛,旨在弥合受控学术评估与实际多媒体取证之间的差距。AT-ADD包含两个赛道:(1) 鲁棒语音深度伪造检测,评估检测器在现实世界场景下以及针对未见过的、最先进的语音生成方法的性能;(2) 全类型音频深度伪造检测,将检测范围扩展到语音之外的各种未知音频类型,并促进跨语音、声音、歌声和音乐的与类型无关的泛化。通过提供标准化数据集、严格的评估协议和可复现的基线,AT-ADD旨在加速鲁棒且可泛化的音频取证技术的发展,在合成音频无处不在的时代支持安全通信、可靠的媒体验证和负责任的治理。

关键词

引用

@article{arxiv.2604.08184,
  title  = {AT-ADD: All-Type Audio Deepfake Detection Challenge Evaluation Plan},
  author = {Yuankun Xie and Haonan Cheng and Jiayi Zhou and Xiaoxuan Guo and Tao Wang and Jian Liu and Weiqiang Wang and Ruibo Fu and Xiaopeng Wang and Hengyan Huang and Xiaoying Huang and Long Ye and Guangtao Zhai},
  journal= {arXiv preprint arXiv:2604.08184},
  year   = {2026}
}

备注

Accepted to the ACM Multimedia 2026 Grand Challenge