中文

BrokenVideos:AI 生成视频中细粒度人工物定位基准数据集

计算机视觉与模式识别 2025-06-26 v1 人工智能

摘要

近期深度生成模型的进展导致视频生成质量取得显著进展,但 AI 生成视频的保真度仍有限。合成内容常常表现出时序不一致的运动、物理上不合理的轨迹、不自然的对象变形和局部模糊等视觉缺陷,这些缺陷削弱了真实感并损害用户信任。准确检测和空间定位这些缺陷对于自动化质量控制以及引导改进生成模型的开发至关重要。然而,当前研究社区缺乏专为 AI 生成视频人工物定位设计的综合基准。现有数据集要么仅限于视频或帧级检测,要么缺乏用于评估定位方法的细粒度空间注释。为填补这一空白,我们提出 BrokenVideos,这是一个包含 3,254 个 AI 生成视频的数据集,配有精心标注的像素级掩码,突出显示视觉损坏的区域。每项注释都经过详细的人类检查,以确保高质量的 ground truth。我们的实验表明,在 BrokenVideos 上训练最先进的检测模型和多模态大语言模型(MLLM)可显著提高其检测受损区域的能力。通过广泛的评估,我们展示 BrokenVideos 为在生成式视频模型上进行人工物定位研究和进步提供了关键基础。数据集可在:https://broken-video-detection-datetsets.github.io/Broken-Video-Detection-Datasets.github.io/ 获取。

关键词

引用

@article{arxiv.2506.20103,
  title  = {BrokenVideos: A Benchmark Dataset for Fine-Grained Artifact Localization in AI-Generated Videos},
  author = {Jiahao Lin and Weixuan Peng and Bojia Zi and Yifeng Gao and Xianbiao Qi and Xingjun Ma and Yu-Gang Jiang},
  journal= {arXiv preprint arXiv:2506.20103},
  year   = {2025}
}

备注

7 page,4 figures,2 tables