面向视频生成模型的物理一致性基准:基于光流引导的帧预测评估
计算机视觉与模式识别
2025-03-06 v3 人工智能
摘要
近期视频生成模型的进展显示出其作为世界模拟器的潜力,但它们往往在偏离物理法则的视频方面表现不佳,这一关键问题被大多数文本到视频基准所忽视。我们提出一个专门用于评估生成视频物理一致性的基准测试,称为PhyCoBench。该基准包含120个提示,覆盖7类物理原理,捕捉视频内容中可观察的关键物理法则。我们对PhyCoBench上的四个最先进(T2V)模型进行评估,并进行了人工评估。此外,我们提出了一个自动化评估模型:PhyCoPredictor,一种以扩散模型生成光流和视频帧的级联方式。通过对自动化和人工排序的一致性评估,实验结果表明PhyCoPredictor目前最接近人类评估。因此,它可以有效评估视频的物理一致性,为未来模型优化提供见解。我们的基准包括物理一致性提示、自动评估工具PhyCoPredictor以及生成的视频数据集,已在GitHub发布:https://github.com/Jeckinchen/PhyCoBench。
引用
@article{arxiv.2502.05503,
title = {A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction},
author = {Yongfan Chen and Xiuwen Zhu and Tianyu Li},
journal= {arXiv preprint arXiv:2502.05503},
year = {2025}
}