中文

PhyT2V:基于 LLM 的迭代自我完善的物理导向文本到视频生成

计算机视觉与模式识别 2025-04-02 v2 人工智能

摘要

文本到视频(T2V)生成最近由基于转换器的扩散模型实现,但当前的 T2V 模型缺乏遵循真实世界常识和物理规则的能力,由于其对物理真实性的理解有限且在时序建模方面存在不足。现有解决方案要么是数据驱动,要么需要额外的模型输入,但无法通用于超出分布域。本文提出了 PhyT2V,这是一种新型数据独立的 T2V 技术,通过在 T2V 提示中启用链式思考和 step-back 推理,扩展了当前 T2V 模型在超出分布域视频生成能力。我们的实验表明,PhyT2V 将现有 T2V 模型遵循真实世界物理规则的能力提升 2.3 倍,相较于 T2V 提示增强器实现 35% 的改进。源代码可在 https://github.com/pittisl/PhyT2V 查看。

关键词

引用

@article{arxiv.2412.00596,
  title  = {PhyT2V: LLM-Guided Iterative Self-Refinement for Physics-Grounded Text-to-Video Generation},
  author = {Qiyao Xue and Xiangyu Yin and Boyuan Yang and Wei Gao},
  journal= {arXiv preprint arXiv:2412.00596},
  year   = {2025}
}

备注

28 pages