中文

POMA-3D:基于点图的3D场景理解方法

计算机视觉与模式识别 2026-05-07 v3

摘要

本文介绍POMA-3D,即首个从点图中学习的自监督3D表示模型。点图在结构化2D网格上编码显式的3D坐标,保留全局3D几何结构,同时与2D基础模型的输入格式兼容。为将丰富的2D先验知识迁移到POMA-3D,设计了一种视图到场景的对齐策略。此外,由于点图相对于标准空间是视图依赖的,我们引入POMA-JEPA,这是一种联合嵌入-预测架构,用于在多个视图之间强制几何一致的点图特征。我们还构建了名为ScenePoint的点图数据集,源自6.5K个房间级RGB-D场景和100万2D图像场景,以促进大规模POMA-3D预训练。实验表明,POMA-3D作为专家和通用3D理解的强大主干网络,能益于包括3D问答、具身导航、场景检索和具身定位等多样化任务,这些任务仅使用几何输入(即3D坐标)即可实现。总体而言,POMA-3D探索了一种基于点图的3D场景理解方法,解决了3D表示学习中预训练先验知识稀缺和数据有限的问题。项目页面:https://matchlab-imperial.github.io/poma3d/

关键词

引用

@article{arxiv.2511.16567,
  title  = {POMA-3D: The Point Map Way to 3D Scene Understanding},
  author = {Ye Mao and Weixun Luo and Ranran Huang and Junpeng Jing and Krystian Mikolajczyk},
  journal= {arXiv preprint arXiv:2511.16567},
  year   = {2026}
}

备注

11 pages, 6 tables, 5 figures