中文

通过VLM引导的物理驱动视频生成迭代自我完善框架

计算机视觉与模式识别 2025-11-26 v1

摘要

近期视频生成技术取得了显著进展,但当前模型仍难以产生成与现实物理原则相吻合的结果。为此,本文提出一种迭代自我完善框架,利用大语言模型和视觉语言模型提供物理感知引导。具体而言,我们引入一种多模态链式思维(MM-CoT)过程,根据物理不一致性反馈不断优化提示词,从而逐步提升生成质量。该方法无需训练即为即插即用,适用于广泛的视频生成模型。实验在PhyIQ基准上表明,我们的方法将Physics-IQ分数从56.31提升至62.38。我们希望本工作是物理一致视频生成的初步探索,并为未来研究提供启示。

关键词

引用

@article{arxiv.2511.20280,
  title  = {Bootstrapping Physics-Grounded Video Generation through VLM-Guided Iterative Self-Refinement},
  author = {Yang Liu and Xilin Zhao and Peisong Wen and Siran Dai and Qingming Huang},
  journal= {arXiv preprint arXiv:2511.20280},
  year   = {2025}
}

备注

ICCV 2025 Physics-IQ Challenge Third Place Solution