动态文本到视频评估:DynamicEval
计算机视觉与模式识别
2025-10-10 v1
摘要
现有的文本到视频(text-to-video,T2V)评估基准如VBench和EvalCrafter存在两个局限性。(i)虽然侧重于主题导向提示或静态镜头场景,但对动态镜头运动(对于产生电影镜头至关重要)的评估尚未得到充分探索。(ii)这些基准通常将视频级别的评分聚合为单个模型级别的评分用于排序生成模型,而这种聚合方式忽略了视频级别的评估——这对于在给定提示下选择更佳视频至关重要。为解决这些问题,我们引入DynamicEval:一个包含系统性精选提示(强调动态镜头运动)的基准,配以45k人工标注的视频对,来自3k个由十个T2V模型生成的视频。DynamicEval评估视频质量的两个关键维度:背景场景一致性和前景物体一致性。对于背景场景一致性,我们基于Vbench运动平滑度指标获取可解释的误差图。我们观察到,尽管Vbench运动平滑度指标在与人类判断方面显示出前景希望,但在两种情况下效果不佳:由于镜头和前景物体运动产生的遮挡/不遮挡现象。基于此,我们提出了一种新型背景一致性指标,利用物体误差图对这两种失效情况进行原则性校正。我们的第二个创新是引入前景一致性指标,通过跟踪每个物体实例中点的邻居来评估物体保真度。大量实验表明,我们提出的指标在视频级别和模型级别上均与人类偏好实现了更强的相关性(提升超过2个百分点),确立了DynamicEval作为更全面基准的地位,用于评估T2V模型在动态镜头运动下的表现。
引用
@article{arxiv.2510.07441,
title = {DynamicEval: Rethinking Evaluation for Dynamic Text-to-Video Synthesis},
author = {Nithin C. Babu and Aniruddha Mahapatra and Harsh Rangwani and Rajiv Soundararajan and Kuldeep Kulkarni},
journal= {arXiv preprint arXiv:2510.07441},
year = {2025}
}
备注
Preprint. Under review. 26 pages, 11 figures, 11 tables. Access the project page in https://nithincbabu7.github.io/DynamicEval