将视频作为自然增强:面向统一 AI 生成图像与视频检测的框架
计算机视觉与模式识别
2026-05-22 v1 人工智能
摘要
AI 生成内容(AIGC)正在快速提升,迫切需要能够在数据来源、部署管道和视觉模态之间普遍鲁棌的检测器。一个高度普适的检测器应在分布式变化下保持稳健。然而,我们发现了一个持续存在的失效模式:最先进的 AI 生成图像检测器在应用于视频帧时常常失效。通过系统化分析,我们展示了这种跨模态差距源于两种因素:一种是与合成无关的视频处理偏移,包括颜色转换、编解码压缩、调整大小和模糊处理;另一种是现代视频生成器引入的模型特定指纹。针对上述发现,我们提出了 VINA(Video as Natural Augmentation),一个统一的 AIGC 检测框架,联合训练图像和视频数据。VINA 将视频帧用作物理上确定的自然增强,并进一步引入跨模态监督对比目标,以在共享的真实/假决策边界下对齐图像和视频表征。在 14 个图像、视频和野外基准测试中进行了广泛实验,表明 VINA 能够实现双向收益,提高鲁棒性和可迁移性,在几乎所有评估场景下均实现最先进的性能,而无需复杂的数据增强或数据集特定的调参。
引用
@article{arxiv.2605.21977,
title = {Video as Natural Augmentation: Towards Unified AI-Generated Image and Video Detection},
author = {Zhengcen Li and Chenyang Jiang and Liangxu Su and Tong Shao and Shiyang Zhou and Ming Tao and Jingyong Su},
journal= {arXiv preprint arXiv:2605.21977},
year = {2026}
}