PhysInOne:一个综合套件中的视觉物理学习与推理
计算机视觉与模式识别
2026-04-13 v1 人工智能
机器学习
机器人学
摘要
我们提出 PhysInOne,一个大规模合成数据集,以解决 AI 系统缺乏物理依据训练数据的瓶颈。与现有仅包含数千甚至数万个样本的数据集不同,PhysInOne 提供 200 万个视频,覆盖 153810 个动态 3D 场景,涵盖机械、光学、流体动力学和磁场等 71 项基本物理现象。与前述工作不同,我们的场景包含多对象相互作用,背景复杂,并提供全面的 ground-truth 标注,包括 3D 几何、语义、动态运动、物理属性和文本描述。我们在四个新兴应用中展示了 PhysInOne 的效用:物理感知视频生成、长/短期未来帧预测、物理属性估计和运动迁移。实验表明,在 PhysInOne 上微调基础模型显著提升物理合理性,同时也暴露了在建模复杂物理动力学和估计内在属性方面的关键缺口。作为规模远超前述工作的数据集,PhysInOne 建立了新的基准,推动物理依据世界模型在生成、仿真和具身 AI 中的发展。
引用
@article{arxiv.2604.09415,
title = {PhysInOne: Visual Physics Learning and Reasoning in One Suite},
author = {Siyuan Zhou and Hejun Wang and Hu Cheng and Jinxi Li and Dongsheng Wang and Junwei Jiang and Yixiao Jin and Jiayue Huang and Shiwei Mao and Shangjia Liu and Yafei Yang and Hongkang Song and Shenxing Wei and Zihui Zhang and Peng Huang and Shijie Liu and Zhengli Hao and Hao Li and Yitian Li and Wenqi Zhou and Zhihan Zhao and Zongqi He and Hongtao Wen and Shouwang Huang and Peng Yun and Bowen Cheng and Pok Kazaf Fu and Wai Kit Lai and Jiahao Chen and Kaiyuan Wang and Zhixuan Sun and Ziqi Li and Haochen Hu and Di Zhang and Chun Ho Yuen and Bing Wang and Zhihua Wang and Chuhang Zou and Bo Yang},
journal= {arXiv preprint arXiv:2604.09415},
year = {2026}
}
备注
CVPR 2026. Siyuan, Hejun, Hu, Jinxi, Dongsheng, Junwei, Yixiao, Jiayue, and Shiwei are co-first authors. Project page: https://vlar-group.github.io/PhysInOne.html