中文

VideoScore:用于模拟细粒度人类反馈的自动视频生成指标构建

计算机视觉与模式识别 2024-10-15 v3 人工智能

摘要

近年来视频生成技术取得了显著进展,但自动视频指标的开发却滞后于人类评估。现有指标均无法对生成视频提供可靠评分,其主要障碍在于缺乏大规模的人工标注数据集。本文首次发布 VideoFeedback,包含 37.6 万个合成视频的多维度人类评分数据,涵盖 11 个现有视频生成模型。我们在 VideoFeedback 上训练 VideoScore(基于 Mantis 初始化),实现自动视频质量评估。实验表明,VideoScore 与人类评分在 VideoFeedback-test 上的斯皯曼相关系数可达 77.1,显著超越 prior best 指标约 50 分。在其他独立评估集 EvalCrafter、GenAI-Bench 和 VBench 上,VideoScore 始终显示出对人类评判者的相关性远高于其他指标。基于上述结果,我们认为 VideoScore 可作为人类评估者的优秀代理,既可用于(1)评估不同视频模型的性能以跟踪进展,也可用于(2)在强化人类反馈(RLHF)中模拟细粒度人类反馈以改进当前视频生成模型。

关键词

引用

@article{arxiv.2406.15252,
  title  = {VideoScore: Building Automatic Metrics to Simulate Fine-grained Human Feedback for Video Generation},
  author = {Xuan He and Dongfu Jiang and Ge Zhang and Max Ku and Achint Soni and Sherman Siu and Haonan Chen and Abhranil Chandra and Ziyan Jiang and Aaran Arulraj and Kai Wang and Quy Duc Do and Yuansheng Ni and Bohan Lyu and Yaswanth Narsupalli and Rongqi Fan and Zhiheng Lyu and Yuchen Lin and Wenhu Chen},
  journal= {arXiv preprint arXiv:2406.15252},
  year   = {2024}
}