中文

基于时空似然值的无训练生成视频检测

计算机视觉与模式识别 2026-03-19 v2 机器学习

摘要

跟随文本和图像生成的快速进步,视频领域也迎来了高水平的生成模型,产生高度逼真且可控的序列。尽管如此,这些模型也引发了关于误信息的严重担忧,使得可靠的合成视频检测变得至关重要。基于图像的检测器受限于逐帧处理,忽略了时序动态;而有监督的视频检测器对未见生成器泛化性差,这在新模型迅速涌现的背景下尤为致命。这些挑战激励了零样本方法,这些方法无需合成数据,而是将内容评分为与真实数据统计的似然值,从而实现无训练、模型无关的检测。我们引入了 STALL,这是一个简单、无训练、理论上得到正当性认可的检测器,为视频提供基于似然值的评分,联合建模空间和时间证据。我们在两个公开基准上评估了 STALL,并引入了 ComGenVid—a new benchmark with state-of-the-art generative models。STALL 在所有基准上一致优于先前的基于图像和视频的基线方法。代码和数据可在 https://omerbenhayun.github.io/stall-video 获取。

关键词

引用

@article{arxiv.2603.15026,
  title  = {Training-free Detection of Generated Videos via Spatial-Temporal Likelihoods},
  author = {Omer Ben Hayun and Roy Betser and Meir Yossef Levi and Levi Kassel and Guy Gilboa},
  journal= {arXiv preprint arXiv:2603.15026},
  year   = {2026}
}

备注

Accepted to CVPR 2026