中文

VLM6D:基于RGB-D图像的视觉语言模型6自由位姿估计

计算机视觉与模式识别 2025-11-04 v1 人工智能

摘要

计算机视觉中的核心挑战在于精确计算物体的6D姿态,但许多现有方法在面对真实场景中不稳健,难以从合成数据泛化到光照变化、无纹理物体及显著遮挡的实际场景。为此,我们提出VLM6D,一种新型双流架构,利用RGB-D输入的视觉与几何数据特性,实现稳健且精确的姿态估计。该框架独特地集成了两种专用编码器:强大的无监督视觉Transformer(DINOv2)处理RGB模态,凭借其丰富的预训练视觉语法理解能力,实现对纹理和光照变化的卓越鲁棒性;同时,PointNet++编码器处理由深度数据生成的3D点云, enable 即使在严重遮挡导致的稀疏、碎片化数据下,也能进行稳健的几何推理。这两种互补特征流有效融合,用于信息化多任务预测头。我们通过全面实验表明,VLM6D在具有挑战性的Occluded-LineMOD数据集上实现了新的SOTA性能,验证了其卓越的鲁棒性和准确性。

关键词

引用

@article{arxiv.2511.00120,
  title  = {VLM6D: VLM based 6Dof Pose Estimation based on RGB-D Images},
  author = {Md Selim Sarowar and Sungho Kim},
  journal= {arXiv preprint arXiv:2511.00120},
  year   = {2025}
}

备注

This paper has been accepted to IEIE( The Institute Of Electronics and Information Engineering, South Korea) Fall,2025 Conference