带可解释推理的 AI 生成视频检测:DAVID-XR1
计算机视觉与模式识别
2025-06-19 v1 人工智能
摘要
随着 AI 生成视频在媒体平台上的日益普及,可靠区分合成内容与真实录像的能力已成为迫切且关键的需求。现有方法主要将此挑战视为二元分类任务,仅能提供有限的关于模型识别视频为 AI 生成的依据所在或原因。然而,核心挑战远不止于检测细微痕迹,而是需要为审计员和最终用户提供细致、令人信服的证据。为此,我们引入 DAVID-X,首个将 AI 生成视频与详细缺陷级时空标注和书面理由配对的数据集。利用这些丰富的标注,我们提出 DAVID-XR1,一种视频语言模型,旨在提供可解释的视觉推理链——包括缺陷分类、时空局部化和自然语言解释。这种方法将 AI 生成视频检测从不可见的黑箱决策转变为透明且可验证的诊断过程。我们展示,一个通用性强的骨干网络经我们的紧凑数据集微调并结合链步思蒸馏,可在多种生成器和生成模式下实现强大的泛化。我们的结果凸显了可解释检测方法在可信识别 AI 生成视频内容方面的潜力。
引用
@article{arxiv.2506.14827,
title = {DAVID-XR1: Detecting AI-Generated Videos with Explainable Reasoning},
author = {Yifeng Gao and Yifan Ding and Hongyu Su and Juncheng Li and Yunhan Zhao and Lin Luo and Zixing Chen and Li Wang and Xin Wang and Yixu Wang and Xingjun Ma and Yu-Gang Jiang},
journal= {arXiv preprint arXiv:2506.14827},
year = {2025}
}