中文

EA-Swin:用于 AI 生成视频检测的嵌入无关 Swin Transformer

计算机视觉与模式识别 2026-03-06 v2

摘要

近期基石级视频生成器如 Sora2、Veo3 等的快速发展产生了高度逼真的合成视频,暴露了依赖浅层嵌入轨迹、基于图像的适应或计算密集型多模态大语言模型(MLLM)的现有检测方法的局限性。我们提出了 EA-Swin,这是一个在预训练视频嵌入上通过分解窗口注意力设计直接建模时空依赖性的嵌入无关 Swin Transformer,能够与通用的 ViT 风格补丁编码器兼容。此外,我们构建了 EA-Video 数据集,包含 130 万个视频,整合新收集的样本与精选现有数据集,涵盖多样化的商业与开源生成器,并包括未见生成器划分,以进行严格的跨分布评估。大量实验表明,EA-Swin 在主要生成器上实现 0.97-0.99 的准确率,超越了以往 SOTA 方法(通常 0.8-0.9)5-20% 的优势,同时在未见分布上保持强大的泛化能力,为现代 AI 生成视频检测提供了可扩展且稳健的解决方案。

关键词

引用

@article{arxiv.2602.17260,
  title  = {EA-Swin: An Embedding-Agnostic Swin Transformer for AI-Generated Video Detection},
  author = {Hung Mai and Loi Dinh and Duc Hai Nguyen and Dat Do and Luong Doan and Khanh Nguyen Quoc and Huan Vu and Naeem Ul Islam and Tuan Do},
  journal= {arXiv preprint arXiv:2602.17260},
  year   = {2026}
}

备注

2nd preprint version