ChronoMagic-Bench: A Benchmark for Metamorphic Evaluation of Text-to-Time-lapse Video Generation
计算机视觉与模式识别
2024-10-03 v2 计算与语言
摘要
我们提出了一种新颖的文本到视频(T2V)生成基准,ChronoMagic-Bench,用于评估T2V模型(如Sora和Lumiere)在时间插图视频生成中的时序和变形能力。与现有关注视觉质量和文本相关性的基准不同,ChronoMagic-Bench聚焦于模型生成具有显著变形幅度和时序连贯性的时间插图视频的能力。该基准以自由形式文本查询探索T2V模型的物理、生物和化学能力。为此 purpose,ChronoMagic-Bench引入1649个提示词和真实世界视频作为参考,分为四大类时间插图视频:生物学、人造、气象和物理现象,进一步细分为75个子类。这种分类全面评估了模型处理多样和复杂变换的能力。为确保人类偏好与基准一致,我们引入两种新的自动指标,MTScore和CHScore,分别评估视频的变形属性和时序连贯性。MTScore衡量变形幅度,反映随时间变化的程度;CHScore评估时序连贯性,确保生成视频保持逻辑性和连续性。基于ChronoMagic-Bench,我们对十个代表性T2V模型进行了全面的人工评估,揭示了它们在不同提示词类别中的优势和不足,提供了解决当前视频生成研究空白的全面评估框架。此外,我们创建了一个大规模ChronoMagic-Pro数据集,包含46万对720p时间插图视频和详细描述,确保高物理相关性和大变形幅度。[主页](https://pku-yuangroup.github.io/ChronoMagic-Bench/)
引用
@article{arxiv.2406.18522,
title = {ChronoMagic-Bench: A Benchmark for Metamorphic Evaluation of Text-to-Time-lapse Video Generation},
author = {Shenghai Yuan and Jinfa Huang and Yongqi Xu and Yaoyang Liu and Shaofeng Zhang and Yujun Shi and Ruijie Zhu and Xinhua Cheng and Jiebo Luo and Li Yuan},
journal= {arXiv preprint arXiv:2406.18522},
year = {2024}
}
备注
NeurIPS D&B 2024 (Spotlight)