RobustSora:面向鲁棒AI生成视频检测的去水印基准
计算机视觉与模式识别
2026-05-08 v2 人工智能
摘要
AI生成视频模型的普及带来了对信息完整性和数字信任的新挑战。但一个关键问题尚未被充分解决:商业生成器会嵌入可见的水印用于来源追踪,然而现有基准测试未控制此变量,导致检测器可能仅学习水印模式而非真正的生成特征。我们提出RobustSora,包含6500个手动验证视频的基准测试,分为四类:Authentic-Clean(A-C)、Generated-Watermarked(G-W)、Generated-DeWatermarked(G-DeW)和Authentic-Spoofed(A-S),分别来自Vript、DVF和UltraVideo(真实视频)以及Sora、Sora 2、Pika、Open-Sora 2和KLing(生成视频)。两个评估任务分离水印效应:任务I(水印消除鲁棒性)测试水印被移除的AI视频检测;任务II(水印欺骗鲁棒性)衡量在真实视频上注入假水印的误报率。在十个模型(包括专用检测器、变换器分类器和多模态大语言模型)上,水印操作导致准确率变化为至个百分点(平均6.6个百分点;的7/10模型在每个任务上均显著)。一个无效对照将inpainting-特征混淆限制在2个百分点内,水印感知的训练数据增强能在两个任务上恢复3-4个百分点的准确率,共同提供了检测器主动依赖水印线索的因果证据。按生成器细分显示,Sora 2导致至个百分点的性能下降,而Pika和Open-Sora 2仅为至个百分点,表明水印显著程度而非检测器架构是主要依赖驱动因素。这些结果主张在AI生成视频检测中采用水印感知的评估与训练。数据集、评估代码和预训练模型将公开释放。
引用
@article{arxiv.2512.10248,
title = {RobustSora: De-Watermarked Benchmark for Robust AI-Generated Video Detection},
author = {Zhuo Wang and Xiliang Liu and Ligang Sun},
journal= {arXiv preprint arXiv:2512.10248},
year = {2026}
}