AVFakeBench:面向 AV-LMMs 的综合音视频伪造检测基准
计算机视觉与模式识别
2026-03-16 v3
摘要
音视频 (Audio-Video, AV) 伪造的威胁正快速演变,超越人物深度伪造,涵盖更广泛且复杂的自然场景中的多样化操纵。然而,现有基准仍局限于基于深度伪造的伪造技术,且仅提供单粒度标注,无法捕捉真实世界伪造场景的多样性和复杂性。为此,本文引入 AVFakeBench,首个覆盖人物主体与通用主体等多维伪造语义的综合音视频伪造检测基准。AVFakeBench 包含 12K 条精心筛选的音视频问题,覆盖七类伪造类型和四级标注。为确保伪造质量和多样性,本文提出一种多阶段混合伪造框架,集成任务规划专属模型与专家生成模型实现精准操纵。基准建立了涵盖二元判断、伪造类型分类、伪造细节选择和解释推理的多任务评估框架。我们在 AVFakeBench 上评估了 11 个音视频大语言模型 (AV-LMMs) 和 2 种主流检测方法,表明 AV-LMMs 作为新兴伪造检测器具有潜力,同时揭示其在细粒度感知与推理方面的显著弱点。
引用
@article{arxiv.2511.21251,
title = {AVFakeBench: A Comprehensive Audio-Video Forgery Detection Benchmark for AV-LMMs},
author = {Shuhan Xia and Peipei Li and Xuannan Liu and Dongsen Zhang and Xinyu Guo and Zekun Li},
journal= {arXiv preprint arXiv:2511.21251},
year = {2026}
}
备注
The experimental results in this paper have been further improved and updated; the baseline results do not match existing results, therefore the paper needs to be retracted