World-R1:用于文本到视频生成强化3D约束
计算机视觉与模式识别
2026-05-27 v4
摘要
最近的视频基础模型在视觉合成方面表现突出,但经常存在几何不一致问题。虽然现有方法试图通过架构修改注入3D先验,但往往计算成本高昂且限制可扩展性。我们提出World-R1,通过强化学习将视频生成与3D约束对齐。为实现这一对齐,我们引入专门的纯文本数据集,用于世界模拟。利用Flow-GRPO,我们通过来自预训练3D基础模型和视觉语言模型的反馈进行优化,以强制结构连贯性,而无需修改底层架构。我们进一步采用周期性解耦训练策略,以平衡刚性几何一致性与动态场景的流畅性。广泛的评估表明,我们的方法显著提升了3D一致性,同时保留了基础模型的原始视觉质量,有效弥合了视频生成与可扩展世界模拟之间的差距。
引用
@article{arxiv.2604.24764,
title = {World-R1: Reinforcing 3D Constraints for Text-to-Video Generation},
author = {Weijie Wang and Xiaoxuan He and Youping Gu and Yifan Yang and Zeyu Zhang and Yefei He and Yanbo Ding and Xirui Hu and Donny Y. Chen and Zhiyuan He and Yuqing Yang and Bohan Zhuang},
journal= {arXiv preprint arXiv:2604.24764},
year = {2026}
}
备注
ICML 2026, Project Page: https://aka.ms/world-r1, Code: https://github.com/microsoft/World-R1