文本到视频生成模型评估:从动态视角
计算机视觉与模式识别
2024-07-02 v1
摘要
全面且建设性的评估协议对于开发高级文本到视频 (T2V) 生成模型至关重要。现有评估协议主要关注时间一致性和内容连续性,却大体忽略了视频内容的动态特性。动态是衡量视频视觉生动性和视频内容忠实于文本提示的重要维度。本研究提出一种有效的评估协议,称为 DEVIL,聚焦于动态维度来评估 T2V 模型。为此,我们建立了一个新基准,包含充分反映多种动态等级的文本提示,并定义一组对应不同时间粒度的动态得分,以全面评估每个生成视频的动态特性。基于新基准和动态得分,我们设计了三个指标来评估 T2V 模型:动态范围、动态可控性和基于动态的质量。实验表明,DEVIL 与人类评分的皮尔逊相关系数超过 90%,显示其在推动 T2V 生成模型方面的潜力。代码已公开于 https://github.com/MingXiangL/DEVIL。
引用
@article{arxiv.2407.01094,
title = {Evaluation of Text-to-Video Generation Models: A Dynamics Perspective},
author = {Mingxiang Liao and Hannan Lu and Xinyu Zhang and Fang Wan and Tianyu Wang and Yuzhong Zhao and Wangmeng Zuo and Qixiang Ye and Jingdong Wang},
journal= {arXiv preprint arXiv:2407.01094},
year = {2024}
}