Skyra: 基于 grounded artifact 推理的人类可感知 AI 生成视频检测
计算机视觉与模式识别
2026-05-18 v2
摘要
AI 生成视频技术的滥用引发了严重的社会担忧,凸显了迫切需要可靠的 AI 生成视频检测器的作用。然而,大多数现有方法仅限于二元分类,缺乏人类解读所需的解释。本文提出 Skyra,一种专门的多模态大语言模型(MLLM),识别 AI 生成视频中的人类可感知视觉瑕疵,并将其作为 grounding 证据用于检测和解释。为支持这一目标,我们构建 ViF-CoT-4K 用于监督式微调(SFT),该数据集是首个大规模 AI 生成视频瑕疵数据集,包含细粒度的人类注释。我们随后开发了两阶段训练策略,系统性地提升模型的时空瑕疵感知、解释能力和检测准确性。为全面评估 Skyra,我们引入 ViF-Bench,包含由超过十个 state-of-the-art 视频生成器生成的 3000 份高质量样本。广泛的实验表明,Skyra 在多个基准测试中超越了现有方法,而我们的评估为推动可解释 AI 生成视频检测提供了宝贵见解。
引用
@article{arxiv.2512.15693,
title = {Skyra: AI-Generated Video Detection via Grounded Artifact Reasoning},
author = {Yifei Li and Wenzhao Zheng and Yanran Zhang and Runze Sun and Yu Zheng and Lei Chen and Jie Zhou and Jiwen Lu},
journal= {arXiv preprint arXiv:2512.15693},
year = {2026}
}
备注
Camera Ready Version. Project Page: https://github.com/JoeLeelyf/Skyra