从 2D 观察中学习通用 3D 场景表示
计算机视觉与模式识别
2026-02-12 v1 机器人学
摘要
我们提出一种通用的神经辐射场方法,用于从机器人视角观察预测 3D 工作空间占用。不同于以前在相机中心坐标系中运行的方法,our model 在全局工作空间坐标系中构建占用表示,使其直接适用于机器人操作。该模型集成了灵活的源视图,并能对未见的对象安排进行泛化,而无需场景特定的微调。我们在人oid 机器人上演示了该方法,并将预测的几何与 3D 传感器 ground truth 进行评估。在 40 个真实场景上训练的模型实现了 26mm 的重建误差,包括遮挡区域,验证了其推断出超越传统立体视觉方法的完整 3D 占用的能力。
引用
@article{arxiv.2602.10943,
title = {Towards Learning a Generalizable 3D Scene Representation from 2D Observations},
author = {Martin Gromniak and Jan-Gerrit Habekost and Sebastian Kamp and Sven Magg and Stefan Wermter},
journal= {arXiv preprint arXiv:2602.10943},
year = {2026}
}
备注
Paper accepted at ESANN 2026