FreeGave:基于高斯速度的动态视频3D物理学习
计算机视觉与模式识别
2025-06-10 v1 人工智能
计算工程、金融与科学
机器学习
机器人学
摘要
本文旨在从多视角视频中纯粹建模3D场景几何、外观及其背后的物理。现有工作通过将各种支配偏微分方程作为PINN损失或将物理仿真纳入神经网络,常常无法学习边界处复杂物理运动,或需要对象先验,如掩码或类型。在本文中,我们提出FreeGave以无需任何对象先验学习复杂动态3D场景的物理。我们方法的关键在于引入物理代码,随后设计一个仔细的发散无关模块用于估计每个高斯的速度场,而无需依赖低效的PINN损失。在三个公开数据集和一个新收集的具有挑战性的真实世界数据集上进行大量实验,显示我们方法在未来帧外推和运动分割方面表现优异。最突出的是,我们对所学物理代码的调查表明,它们在训练时不依赖任何人类标签,真正学习了有意义的3D物理运动模式。
引用
@article{arxiv.2506.07865,
title = {FreeGave: 3D Physics Learning from Dynamic Videos by Gaussian Velocity},
author = {Jinxi Li and Ziyang Song and Siyuan Zhou and Bo Yang},
journal= {arXiv preprint arXiv:2506.07865},
year = {2025}
}
备注
CVPR 2025. Code and data are available at: https://github.com/vLAR-group/FreeGave