中文

基于概率流守恒的AI生成视频检测的物理驱动时空建模

计算机视觉与模式识别 2025-10-10 v1 机器学习

摘要

AI生成视频已实现接近完美的视觉逼真(如Sora),亟需可靠的检测机制。然而,检测此类视频面临在建模高维时空动力学和识别违反物理法则的细微异常方面的重大挑战。本文提出一种基于概率流守恒原理的AI生成视频检测范式。具体而言,我们提出一种称为归一化时空梯度(Normalized Spatiotemporal Gradient, NSG)的统计量,用于量化空间概率梯度与时间密度变化之比,显式捕捉自然视频动力学的偏差。利用预训练扩散模型,我们通过空间梯度近似和运动感知的时间建模开发了NSG估计器,而无需复杂的运动分解,同时保持物理约束。基于此,我们提出一种基于NSG的视频检测方法(NSG-VD),将测试视频与真实视频的NSG特征之间的最大均值不等式(Maximum Mean Discrepancy, MMD)作为检测指标。最后,我们推导NSG特征在真实视频和生成视频之间的距离上界,证明生成视频因分布偏移而表现出放大的差异。大量实验表明,NSG-VD在召回率上优于最先进的基准提高16.00%,F1分数提升10.75%,验证了NSG-VD的卓越性能。源代码可在 https://github.com/ZSHsh98/NSG-VD 获取。

关键词

引用

@article{arxiv.2510.08073,
  title  = {Physics-Driven Spatiotemporal Modeling for AI-Generated Video Detection},
  author = {Shuhai Zhang and ZiHao Lian and Jiahao Yang and Daiyuan Li and Guoxuan Pang and Feng Liu and Bo Han and Shutao Li and Mingkui Tan},
  journal= {arXiv preprint arXiv:2510.08073},
  year   = {2025}
}

备注

Accepted at NeurIPS 2025 spotlight