通过多模态 LLM 学习人类感知的 AI 生成视频虚假性
计算机视觉与模式识别
2025-10-02 v2 人工智能
计算与语言
摘要
人类能否识别 AI 生成(伪造)的视频并提供有依据的理由?尽管视频生成模型发展迅速,但一个关键维度——人类能否检测生成视频中的深度伪造痕迹,即揭示视频为机器生成的时空定位视觉伪影——在很大程度上被忽略了。我们引入了 DeeptraceReward,这是首个细粒度的、具有空间和时间感知的基准,用于标注人类感知的伪造痕迹以进行视频生成奖励。该数据集包含跨 3.3K 个高质量生成视频的 4.3K 条详细标注。每条标注提供一段自然语言解释,标定包含所感知痕迹的边界框区域,并标记精确的起始和结束时间戳。我们将这些标注整合为 9 大类导致人类将视频识别为 AI 生成的深度伪造痕迹,并训练多模态语言模型 (LMs) 作为奖励模型以模仿人类的判断和定位。在 DeeptraceReward 上,我们的 7B 奖励模型在伪造线索识别、定位和解释方面的平均表现比 GPT-5 高出 34.7%。有趣的是,我们观察到一致的难度梯度:二分类伪造与真实分类显著易于细粒度深度伪造痕迹检测;在后者中,性能从自然语言解释(最易)到空间定位再到时间标注(最难)依次下降。通过突显人类感知的深度伪造痕迹,DeeptraceReward 为具有社会意识和可信度的视频生成提供了严格的测试平台和训练信号。
引用
@article{arxiv.2509.22646,
title = {Learning Human-Perceived Fakeness in AI-Generated Videos via Multimodal LLMs},
author = {Xingyu Fu and Siyi Liu and Yinuo Xu and Pan Lu and Guangqiuse Hu and Tianbo Yang and Taran Anantasagar and Christopher Shen and Yikai Mao and Yuanzhe Liu and Keyush Shah and Chung Un Lee and Yejin Choi and James Zou and Dan Roth and Chris Callison-Burch},
journal= {arXiv preprint arXiv:2509.22646},
year = {2025}
}
备注
Project Page: https://deeptracereward.github.io/