中文

利用预训练视觉模型进行 AI 生成视频检测

计算机视觉与模式识别 2025-07-18 v1

摘要

近期的生成式 AI(GenAI)技术进展显著提升了生成视觉内容的质量。随着 AI 生成的视觉内容日益难以与真实内容区分,检测这些生成内容的挑战在抵御误information、确保隐私和防止安全威胁方面至关重要。虽然在检测 AI 生成图像方面取得了显著进展,但当前的视频检测方法主要聚焦于 deepfake,仅涉及人类面部。然而,视频生成领域已发展超越 deepfake,亟需能够检测通用内容 AI 生成视频的方法。为填补这一空白,我们提出一种新颖方法,利用预训练视觉模型区分真实与生成视频。这些预训练模型在大量真实视觉内容上进行训练,蕴含可帮助区分真实与生成视频的内在信号。通过这些提取的特征,我们在无需额外模型训练的情况下即可实现高检测性能,并通过在提取特征上添加简单的线性分类层进一步提升性能。我们在构建的数据集(VID-AID)上进行了验证,该数据集包含约 10,000 个由 9 个不同文本到视频模型生成的 AI 生成视频,以及 4,000 个真实视频,总计超过 7 小时的视频内容。我们的评估显示,该方法在平均检测准确率上超过 90%,凸显了其有效性。接受批准后,我们计划公开发布代码、预训练模型和我们的数据集,以支持该关键领域的持续研究。

关键词

引用

@article{arxiv.2507.13224,
  title  = {Leveraging Pre-Trained Visual Models for AI-Generated Video Detection},
  author = {Keerthi Veeramachaneni and Praveen Tirupattur and Amrit Singh Bedi and Mubarak Shah},
  journal= {arXiv preprint arXiv:2507.13224},
  year   = {2025}
}