中文

超越静态人工物:面向视觉语言模型的视频深度伪造推理基准

计算机视觉与模式识别 2026-02-26 v1 人工智能

摘要

当前用于深度伪造检测的视觉语言模型(VLMs)在识别空间人工物方面表现出色,但忽略了一个关键维度:视频伪造的时序不一致性。将 VLMs 适应于推理这些动态线索仍是一个_distinct 挑战。为弥合这一差距,我们提出了 Forensic Answer-Questioning(FAQ)——一个大型基准,將时序深度伪造分析形式化为多选任务。FAQ 引入了一个三级层次结构,逐步评估并使 VLMs 具备法医学能力:(1) 面部感知,测试识别静态视觉人工物的能力;(2) 时序深度伪造定位,要求在帧之间定位动态伪造人工物;(3) 法医学推理,挑战模型综合证据作出最终真实性判断。我们在 FAQ 上评估了各种 VLMs,并生成相应的指令微调集 FAQ-IT。大量实验表明,在 FAQ-IT 上微调的模型在 both in-domain 和 cross-dataset 检测基准上实现了 advanced performance。消融研究进一步验证了我们关键设计选择的影响,确认 FAQ 是 VLMs 时序推理能力的驱动力。

关键词

引用

@article{arxiv.2602.21779,
  title  = {Beyond Static Artifacts: A Forensic Benchmark for Video Deepfake Reasoning in Vision Language Models},
  author = {Zheyuan Gu and Qingsong Zhao and Yusong Wang and Zhaohong Huang and Xinqi Li and Cheng Yuan and Jiaowei Shao and Chi Zhang and Xuelong Li},
  journal= {arXiv preprint arXiv:2602.21779},
  year   = {2026}
}

备注

16 pages, 9 figures. Submitted to CVPR 2026