PhyPrompt:基于强化学习的物理可行文本到视频生成提示词优化
计算机视觉与模式识别
2026-03-05 v1 人工智能
摘要
最先进的文本到视频(T2V)生成器尽管视觉质量高,但经常违反物理定律。我们发现,这源于提示词中物理约束不足,而非模型限制:手动添加物理细节可靠地产生物理可行的视频,但需要专业知识且难以扩展。我们提出了 PhyPrompt,一个两阶段强化学习框架,用于自动优化物理可行生成的提示词。首先,我们在面向物理的链式思考数据集上微调大型语言模型,以集成诸如物体运动和力量相互作用等原理,同时保持用户意图。其次,我们应用带有动态奖励课程的 Group Relative Policy Optimization,课程最初优先语义忠实度,然后逐渐转向物理常识。这一课程实现了协同优化:PhyPrompt-7B 在 VideoPhy2 上实现 40.8% 的联合成功率(提升 8.6 百分点),在物理常识方面提升 11 百分点(从 55.8%提升至 66.8%),同时在语义一致性方面提升 4.4 百分点(从 43.4%提升至 47.8%)。令人惊讶的是,我们的课程在两个指标上都超过了单目标训练,表明在常规多目标权衡之外实现了组合式提示词发现。PhyPrompt 相较于 GPT-4o 提升 3.8%,相较于 DeepSeek-V3 提升 2.2%(参数规模大 100 倍),仅使用 7B 参数即可实现。该方法在 diverse T2V architectures(Lavie、VideoCrafter2、CogVideoX-5B)上以零样本方式迁移,提升幅度达 16.8%,确立了基于领域专业化强化学习配合组合式课程优于通用规模化用于 physics-aware generation。
引用
@article{arxiv.2603.03505,
title = {PhyPrompt: RL-based Prompt Refinement for Physically Plausible Text-to-Video Generation},
author = {Shang Wu and Chenwei Xu and Zhuofan Xia and Weijian Li and Lie Lu and Pranav Maneriker and Fan Du and Manling Li and Han Liu},
journal= {arXiv preprint arXiv:2603.03505},
year = {2026}
}