中文

基于 Vision Transformer 的假视频检测

计算机视觉与模式识别 2025-04-30 v1 人工智能 多媒体

摘要

近期 AI 驱动的多媒体生成技术的进展使得高逼真度的图像和视频生成成为可能,引发关于其在虚假信息传播中潜在作用的广泛关注。生成技术的广泛可访问性——即从提示或现有媒体生成假多媒体的能力——不断得到完善,凸显了对高度准确且具通用性的 AI 生成媒体检测方法的紧迫需求,这一点也得到了欧洲数字 AI 法案等新法规的强调。本文致力于从 Vision Transformer(ViT)驱动的假图像检测思路出发,将其扩展到视频领域。我们提出了一种创新框架,有效整合 ViT 在时间维度上的嵌入,以提升检测性能。该方法在新构建的大型且多样化的数据集上进行评估,该数据集包含使用五种开源生成技术生成的视频,以及另一数据集包含由专有生成方法生成的视频。实验结果表明,我们的方法在准确率、泛化性和少样本学习能力方面均表现有前景。

关键词

引用

@article{arxiv.2504.20669,
  title  = {Advance Fake Video Detection via Vision Transformers},
  author = {Joy Battocchio and Stefano Dell'Anna and Andrea Montibeller and Giulia Boato},
  journal= {arXiv preprint arXiv:2504.20669},
  year   = {2025}
}