Seeing What Matters: 面向泛化的AI生成视频检测与取证增强
计算机视觉与模式识别
2025-11-07 v2
摘要
合成视频生成技术发展极为迅速。最新模型能够生成非常逼真的高分辨率视频,几乎与真实视频无法区分。尽管近期已提出多种视频取证检测器,但它们通常泛化能力较差,限制了其在真实场景中的应用。克服这一问题的关键见解是引导检测器“关注真正重要的内容”。事实上,一个设计良好的取证分类器应专注于识别生成架构引入的固有低级伪影,而非依赖特定模型所特有的高级语义缺陷。本文首先研究了不同的生成架构,寻找并识别出无偏、对损伤鲁棒且跨模型共享的判别性特征。然后,我们引入了一种新颖的基于小波分解的取证导向数据增强策略,通过替换特定的频率相关频带,驱动模型利用更相关的取证线索。我们的新型训练范式提高了AI生成视频检测器的泛化能力,无需复杂的算法和包含多种合成生成器的大型数据集。为评估我们的方法,我们使用来自单个生成模型的数据训练检测器,并针对由多种其他模型生成的视频进行测试。尽管方法简单,但我们的方法在准确率上显著优于现有最先进的检测器,即使在非常新的生成模型(如NOVA和FLUX)上也取得了优异的结果。
引用
@article{arxiv.2506.16802,
title = {Seeing What Matters: Generalizable AI-generated Video Detection with Forensic-Oriented Augmentation},
author = {Riccardo Corvi and Davide Cozzolino and Ekta Prashnani and Shalini De Mello and Koki Nagano and Luisa Verdoliva},
journal= {arXiv preprint arXiv:2506.16802},
year = {2025}
}