中文

基于粒子-网格的神经动力学用于从RGB-D视频中学习可变形物体模型

机器人学 2025-11-07 v2 计算机视觉与模式识别 机器学习

摘要

由于可变形物体具有多样化的物理属性以及从有限视觉信息估计状态的困难,建模可变形物体的动力学具有挑战性。我们提出一种神经动力学框架,通过混合表示结合物体粒子和空间网格来解决上述挑战。我们的粒子-网格模型在捕获全局形状和运动信息的同时,预测密集的粒子运动,从而能够建模具有不同形状和材料的物体。粒子用于表示物体形状,而空间网格离散化三维空间,以确保空间连续性并提高学习效率。结合高斯溅射进行视觉渲染,我们的框架实现了可变形物体的全学习型数字孪 replica,并生成3D动作条件视频。通过实验,我们展示了我们的模型从稀疏视图RGB-D机器人-物体交互录制中学习了多种物体的动力学,包括绳子、布料、玩具动物和纸袋,并在类别级别上对未见实例进行泛化。我们的方法在摄像机视角有限的场景中超越了最新的学习型和物理仿真方法。此外,我们展示了在模型基规划中利用所学模型的实用性,通过实现目标条件物体操控来完成一系列任务。项目页面可在 https://kywind.github.io/pgnd 查看。

关键词

引用

@article{arxiv.2506.15680,
  title  = {Particle-Grid Neural Dynamics for Learning Deformable Object Models from RGB-D Videos},
  author = {Kaifeng Zhang and Baoyu Li and Kris Hauser and Yunzhu Li},
  journal= {arXiv preprint arXiv:2506.15680},
  year   = {2025}
}

备注

Project page: https://kywind.github.io/pgnd