中文

Grab-3D:通过三维几何时间一致性检测 AI 生成视频

计算机视觉与模式识别 2025-12-16 v1

摘要

近期基于扩散的生成技术进展使 AI 模型能够生成高度逼真的视频,凸显了对可靠检测机制的需求。然而,现有检测方法仅对生成视频中的三维几何模式进行了有限的探索。在本文中,我们使用消失点作为三维几何模式的显式表示,揭示了真实视频与 AI 生成视频之间在几何一致性上的根本差异。我们提出了 Grab-3D,一个几何感知的 Transformer 框架,基于三维几何时间一致性来检测 AI 生成视频。为实现可靠评估,我们构建了一个静态场景的 AI 生成视频数据集,允许稳定的三维几何特征提取。我们提出了一种配备几何位置编码、时间-几何注意力和基于 EMA 的几何分类头的几何感知 Transformer,以将三维几何感知显式注入时间建模。实验表明 Grab-3D 显著超越了现有最先进检测器,实现了对未见生成器的鲁棒跨域泛化。

关键词

引用

@article{arxiv.2512.13665,
  title  = {Grab-3D: Detecting AI-Generated Videos from 3D Geometric Temporal Consistency},
  author = {Wenhan Chen and Sezer Karaoglu and Theo Gevers},
  journal= {arXiv preprint arXiv:2512.13665},
  year   = {2025}
}