Artifact-Bench:评估 MLLMs 检测和评估 AI 生成视频中的人工物
计算机视觉与模式识别
2026-05-20 v1
摘要
最近的视频生成模型显著提升了 AI 生成视频的逼真度,但其输出仍存在时间不一致、结构失真和语义不连贯等人工物。虽然多模态大语言模型 (MLLM) 显示出强大的视觉理解能力,但其感知和推理此类人工物的能力尚不明确。现有基准往往缺乏对人工物感知和细粒度诊断推理的系统评估,尤其是在超越照片级内容的多样 AI 生成视频领域。为此,我们引入 Artifact-Bench,这是一个全面评估 MLLMs 在 AI 生成视频人工物检测和分析方面的基准。我们首先建立了逼真度人工物的三级层次分类法,覆盖照片级、动画和 CG 风格视频。基于此分类法,Artifact-Bench 定义了三个互补任务:真实视频与 AI 生成视频的分类、成对逼真度比较以及细粒度人工物识别。对 19 个领先 MLLM 进行实验,揭示了这些模型在人工物感知和推理方面存在显著局限,许多模型在挑战性情境下表现接近随机甚至低于随机。我们进一步观察到 MLLM 判断与人类感知偏好之间存在显著不一致,凸显其作为 AI 生成视频逼真度通用评估器的有限可靠性。
引用
@article{arxiv.2605.18984,
title = {Artifact-Bench: Evaluating MLLMs on Detecting and Assessing the Artifacts of AI-Generated Videos},
author = {Yuqi Tang and Yang Shi and Zhuoran Zhang and Qixun Wang and Xuehai Bai and Yue Ding and Ruizhe Chen and Bohan Zeng and Xinlong Chen and Xuanyu Zhu and Bozhou Li and Yuran Wang and Yifan Dai and Chengzhuo Tong and Xinyu Liu and Yiyan Ji and Yujie Wei and Yuhao Dong and Shilin Yan and Fengxiang Wang and Yi-Fan Zhang and Haotian Wang and Yuanxing Zhang and Pengfei Wan},
journal= {arXiv preprint arXiv:2605.18984},
year = {2026}
}