中文

GenVideoLens:大型视觉语言模型在AI生成视频检测中的短板在何处?

计算机视觉与模式识别 2026-03-20 v1

摘要

近年来,AI生成视频日益逼真且技术日新月异。与此同时,大型视觉语言模型(Large Vision-Language Models,LVLMs)在检测此类内容方面展现出强大的潜力。然而,现有评估协议基本将任务视为二元分类问题,依赖整体准确率等粗粒度指标,无法充分洞察LVLMs在何处成功或失败。为此,我们提出GenVideoLens,一个细粒度基准,支持LVLMs在AI生成视频检测中按维度进行评估。该基准包含400个高度欺骗性的AI生成视频和100个真实视频,由专家横跨感知、光学、物理和时间维度的15个可信度维度进行标注。我们在此基准上评估了十七个代表性LVLMs。我们的分析揭示了显著的维度不平衡:尽管LVLMs在感知线索方面表现相对不错,但在光学一致性、物理交互和时序-因果推理方面仍感困难。模型性能在不同维度间差异显著,一些小型开源模型在特定可信度线索上反而超越了更强的专有模型。时间扰动实验进一步表明,当前LVLMs对时序信息的利用有限。总体而言,GenVideoLens为诊断LVLMs行为提供了洞察,揭示了关键能力缺口,为改进未来AI生成视频检测系统提供了指导。

关键词

引用

@article{arxiv.2603.18625,
  title  = {GenVideoLens: Where LVLMs Fall Short in AI-Generated Video Detection?},
  author = {Yueying Zou and Pei Pei Li and Zekun Li and Xinyu Guo and Xing Cui and Huaibo Huang and Ran He},
  journal= {arXiv preprint arXiv:2603.18625},
  year   = {2026}
}

备注

ECCV 2026 submission. 14 pages, 6 figures, 4 tables. Supplementary material included