中文

GRADEO:基于多步推理的文本到视频生成类人评估

计算机视觉与模式识别 2025-12-23 v2 人工智能 机器学习

摘要

近期视频生成模型的巨大进展展示了其生成高质量视频的潜力,同时也给有效评估带来了挑战。与人类评估不同,现有的自动化评估指标缺乏对视频的高层语义理解和推理能力,因此使其不可行且不可解释。为了填补这一空白,我们整理了 GRADEO-Instruct,一个多维度的 T2V 评估指令微调数据集,包含来自 10 多个现有视频生成模型的 3.3k 个视频,以及由 16k 人类标注转换而来的多步推理评估。随后我们引入了 GRADEO,这是首批专门设计的视频评估模型之一,它通过多步推理对 AI 生成的视频进行可解释的评分和评估。实验表明,我们的方法比现有方法更符合人类评估。此外,我们的基准测试表明,当前的视频生成模型难以生成符合人类推理和复杂真实世界场景的内容。

关键词

引用

@article{arxiv.2503.02341,
  title  = {GRADEO: Towards Human-Like Evaluation for Text-to-Video Generation via Multi-Step Reasoning},
  author = {Zhun Mou and Bin Xia and Zhengchao Huang and Wenming Yang and Jiaya Jia},
  journal= {arXiv preprint arXiv:2503.02341},
  year   = {2025}
}