NEWTON:面向物理基础视频生成的智能体规划
计算机视觉与模式识别
2026-05-20 v2
摘要
视频生成模型产生了视觉上引人注目的结果,但系统性地违反了物理常识——在 VideoPhy-2 上,最佳模型仅实现了 32.6% 的联合准确率。我们识别出一个规范瓶颈:文本提示是对物理世界的有损压缩,省略了完全决定动力学的参数,且任何规模的模型扩展都无法恢复从未被指定的信息。基于这一诊断,我们推导出物理条件必须满足的三个属性——充分性、动态性和可验证性——并表明没有现有方法能同时满足这三者。我们提出了 NEWTON,其中视频生成从系统输出降级为智能体工具箱中的一个动作:一个学习到的规划器协调物理感知工具(关键帧生成、科学计算、提示精炼)以构建丰富的条件,而验证器闭环以进行迭代重规划。规划器是唯一可训练的组件,在实时多轮循环中通过 Flow-GRPO 进行在线优化。在 VideoPhy-2 上,NEWTON 将 LTX-Video 上的联合准确率从 21.4% 提高到 29.7%,将 Veo-3.1 上的联合准确率从 30.7% 提高到 37.4%,且未修改任一生成器。我们的项目页面:https://Newton026.github.io/newton
引用
@article{arxiv.2605.18396,
title = {NEWTON: Agentic Planning for Physically Grounded Video Generation},
author = {Yuxiang Feng and Juncheng Wang and Chao Xu and Yijie Qian and Huihan Wang and Wenlong Hou and Yang Liu and Baigui Sun and Yong Liu and Shujun Wang},
journal= {arXiv preprint arXiv:2605.18396},
year = {2026}
}
备注
project page: https://Newton026.github.io/newton