中文

MJ-VIDEO:视频生成中的细粒度基准测试与视频偏好奖励

计算机视觉与模式识别 2025-02-10 v3

摘要

视频生成领域的最新进展显著提升了根据文本指令合成视频的能力。然而,现有模型仍在指令不对齐、内容幻觉、安全问题和偏见等关键挑战上挣扎。为解决这些局限性,我们引入了MJ-BENCH-VIDEO,一个大规模的视频偏好基准,旨在从五个关键方面评估视频生成:对齐性、安全性、精细度、连贯性与一致性,以及偏见与公平性。该基准包含28个细粒度标准,以提供对视频偏好的全面评估。基于此数据集,我们提出了MJ-VIDEO,一个基于专家混合(MoE)的视频奖励模型,旨在提供细粒度的奖励。MJ-VIDEO能够动态选择相关的专家,根据输入的文本-视频对准确判断偏好。这种架构使得偏好判断更精确、更具适应性。通过在MJ-BENCH-VIDEO上进行广泛的基准测试,我们分析了现有视频奖励模型的局限性,并展示了MJ-VIDEO在视频偏好评估中的优越性能,在整体和细粒度偏好判断上分别实现了17.58%和15.87%的提升。此外,在视频生成中引入MJ-VIDEO进行偏好调优,增强了对齐性能。我们所有的代码、数据和模型均可在https://aiming-lab.github.io/MJ-VIDEO.github.io/获取。

关键词

引用

@article{arxiv.2502.01719,
  title  = {MJ-VIDEO: Fine-Grained Benchmarking and Rewarding Video Preferences in Video Generation},
  author = {Haibo Tong and Zhaoyang Wang and Zhaorun Chen and Haonian Ji and Shi Qiu and Siwei Han and Kexin Geng and Zhongkai Xue and Yiyang Zhou and Peng Xia and Mingyu Ding and Rafael Rafailov and Chelsea Finn and Huaxiu Yao},
  journal= {arXiv preprint arXiv:2502.01719},
  year   = {2025}
}