中文

基于 3D 扩散先验的稀疏视图通用目标级映射

计算机视觉与模式识别 2024-10-10 v1 人工智能 机器人学

摘要

目标级映射通过多视图传感器观测构建具有详细形状和姿态的 3D 场景对象地图。常规方法因部分遮挡和传感器噪声难以构建完整形状并估计准确姿态,因而需要密集观测覆盖所有对象,而在机器人轨迹中难以实现。近期工作引入生成式形状先验实现稀疏视图目标级映射,但仅限于单类别对象。本文提出通用目标级映射系统 GOM,利用支持多类别的 3D 扩散模型作为形状先验,输出所有场景对象对应的神经辐射场 (NeRF) 用于几何与纹理。GOM 包含有效公式,无需微调即可利用传感器测量的额外非线性约束引导预训练扩散模型。我们还发展概率优化公式,将多视图传感器观测与扩散先验联合用于 3D 对象姿态与形状估计。我们的 GOM 系统在稀疏视图下展现出优异的多类别映射性能,实测基准上比现有 SOTA 方法获得更准确的映射结果。我们将开源代码:https://github.com/TRAILab/GeneralObjectMapping

关键词

引用

@article{arxiv.2410.05514,
  title  = {Toward General Object-level Mapping from Sparse Views with 3D Diffusion Priors},
  author = {Ziwei Liao and Binbin Xu and Steven L. Waslander},
  journal= {arXiv preprint arXiv:2410.05514},
  year   = {2024}
}

备注

Accepted by CoRL 2024