中文

LAVID:基于智能代理的扩散生成视频检测框架

计算机视觉与模式识别 2025-02-24 v1

摘要

生成模型在创造高质量视频方面取得了惊人的成就,引发了对数字完整性和隐私漏洞的关注。近期的AI生成内容检测研究在图像领域(如深度伪造)得到广泛关注,但视频领域尚未得到探索。大型视觉语言模型(LVLM)因其强大的推理和多模态能力,成为AI生成内容检测的新兴工具,突破了传统基于深度学习的方法在透明度不足和无法识别新型伪影方面的局限。基于此,我们提出LAVID,一种基于LVLMs的AI生成视频检测框架,具备显式知识增强。我们的核心思想包括:(1)领先的LVLMs可调用外部工具提取有用信息以辅助其视频检测任务;(2)结构化提示会影响LVLM对视频内容信息的解释能力。我们设计的管道自动选择一组显式知识工具进行检测,并通过自我改写方式自适应调整提示结构。不同于以往SOTA方法需训练额外检测器,本方法完全无需训练,仅通过LVLM推理即可完成检测。为促进研究,我们还构建了新的基准数据集\vidfor,包含来自多个视频生成工具生成的高质量视频。评估结果表明,LAVID在四个SOTA LVLM上的F1分数提升了6.2至30.2个百分点。

关键词

引用

@article{arxiv.2502.14994,
  title  = {LAVID: An Agentic LVLM Framework for Diffusion-Generated Video Detection},
  author = {Qingyuan Liu and Yun-Yun Tsai and Ruijian Zha and Victoria Li and Pengyuan Shi and Chengzhi Mao and Junfeng Yang},
  journal= {arXiv preprint arXiv:2502.14994},
  year   = {2025}
}