基于图像与文本的多模态三维网格重建
计算机视觉与模式识别
2025-03-11 v1 计算与语言
摘要
对未见物体的6D物体位姿估计在机器人技术中至关重要,但传统上依赖于需要大量数据集、高计算成本且难以泛化的训练模型。零样本方法消除了训练需求,但依赖于预先存在的3D物体模型,这通常难以获取。为了解决这一问题,我们提出了一种语言引导的少样本3D重建方法,从少量输入图像中重建3D网格。在所提出的流程中,系统接收一组输入图像和一个语言查询。GroundingDINO和Segment Anything Model的组合输出分割掩码,随后利用VGGSfM从中重建稀疏点云。接着,使用Gaussian Splatting方法SuGAR重建网格。在最后的清理步骤中,去除伪影,得到所查询物体的最终3D网格。我们从几何和纹理的准确性与质量方面对该方法进行了评估。此外,我们研究了成像条件(如视角、输入图像数量和图像重叠度)对3D物体重建质量、效率和计算可扩展性的影响。
引用
@article{arxiv.2503.07190,
title = {Multi-Modal 3D Mesh Reconstruction from Images and Text},
author = {Melvin Reka and Tessa Pulli and Markus Vincze},
journal= {arXiv preprint arXiv:2503.07190},
year = {2025}
}
备注
under review