中文

VidGuard-R1: 通过推理 MLLM 与强化学习实现 AI 生成视频的检测与解释

计算机视觉与模式识别 2026-03-06 v3 机器学习

摘要

AI 生成视频的快速激增需要具备高准确率和人类可解释解释的鲁棒检测工具。虽然现有的基于 MLLM 的检测器依赖于监督微调 (SFT) 或直接偏好优化 (DPO),但这些方法常常受限于静态、预标注的数据集,这些数据集无法捕捉现代生成模型不断演变的多步物理不一致性。为了弥合这一差距,我们引入了 VidGuard-R1,这是首个利用组相对策略优化 (GRPO) 的视频真实性检测器。超越被动的偏好匹配,VidGuard-R1 采用强化学习框架,鼓励模型探索并对多条推理路径进行排序。通过引入针对时间稳定性和扩散感知复杂性的专用奖励模型,我们激励模型发现“基于物理”的伪影。我们的贡献包括:(1) 一个包含 140,000 个具有挑战性的真实/伪造视频对的精选数据集;(2) 一个基于 GRPO 的训练范式,实现了最先进的零样本性能;(3) 一个推理优先的架构,为其取证判断提供精确、可验证的理由。项目网站:https://vidguard-r1.github.io/。

关键词

引用

@article{arxiv.2510.02282,
  title  = {VidGuard-R1: AI-Generated Video Detection and Explanation via Reasoning MLLMs and RL},
  author = {Kyoungjun Park and Yifan Yang and Juheon Yi and Shicheng Zheng and Yifei Shen and Dongqi Han and Caihua Shan and Muhammad Muaz and Lili Qiu},
  journal= {arXiv preprint arXiv:2510.02282},
  year   = {2026}
}

备注

Accepted to ICLR 2026