PhyWorld:用于视频生成的物理忠实世界模型
计算机视觉与模式识别
2026-05-20 v1 人工智能
新兴技术
机器学习
多媒体
摘要
世界模拟器可为Physical AI系统的训练提供安全且可扩展的环境,使其在实际部署前能够进行测试。大型视频生成模型正成为一种有前景的基础,因其能够生成多样且逼真的视觉未来。然而,将其用作世界模拟器需要能够产生保持物理状态的视频延续,即生成的视频要保留条件输入所暗示的物理状态,并以符合基本物理原理的方式演化。我们提出PhyWorld——一种通过两阶段后训练实现视频生成世界模型的框架,以产生在时间上连贯且物理忠实的场景延续。在第一阶段,我们通过流匹配精细调校改进视频到视频的延续,鼓励跨帧保持稳定的视觉属性和连贯的运动动力学。在第二阶段,我们使用Direct Preference Optimization (DPO) 对物理偏好配对进行对齐,引导模型产生更具物理合理性的输出。为评估PhyWorld,我们使用标准视频质量基准以及一个专门的物理忠实性基准(包含每个定律评分)。实验表明,PhyWorld在视频一致性方面取得改进,在VBench上平均得分为0.769,优于0.756或更低的SOTA基线。PhyWorld在物理合理性方面也取得改进,在我们的物理忠实性基准上平均得分为3.09,优于最强基线的2.99。这些结果表明,通过延续信号和物理偏好信号对大型视频生成模型进行后训练,能够使其更有效地作为Physical AI的世界模拟器。
引用
@article{arxiv.2605.19242,
title = {PhyWorld: Physics-Faithful World Model for Video Generation},
author = {Pu Zhao and Juyi Lin and Timothy Rupprecht and Arash Akbari and Chence Yang and Rahul Chowdhury and Elaheh Motamedi and Arman Akbari and Yumei He and Chen Wang and Geng Yuan and Weiwei Chen and Yanzhi Wang},
journal= {arXiv preprint arXiv:2605.19242},
year = {2026}
}