中文

从 2D 观察中学习通用 3D 场景表示

计算机视觉与模式识别 2026-02-12 v1 机器人学

摘要

我们提出一种通用的神经辐射场方法,用于从机器人视角观察预测 3D 工作空间占用。不同于以前在相机中心坐标系中运行的方法,our model 在全局工作空间坐标系中构建占用表示,使其直接适用于机器人操作。该模型集成了灵活的源视图,并能对未见的对象安排进行泛化,而无需场景特定的微调。我们在人oid 机器人上演示了该方法,并将预测的几何与 3D 传感器 ground truth 进行评估。在 40 个真实场景上训练的模型实现了 26mm 的重建误差,包括遮挡区域,验证了其推断出超越传统立体视觉方法的完整 3D 占用的能力。

关键词

引用

@article{arxiv.2602.10943,
  title  = {Towards Learning a Generalizable 3D Scene Representation from 2D Observations},
  author = {Martin Gromniak and Jan-Gerrit Habekost and Sebastian Kamp and Sven Magg and Stefan Wermter},
  journal= {arXiv preprint arXiv:2602.10943},
  year   = {2026}
}

备注

Paper accepted at ESANN 2026