NVSMask3D: 基于相机姿态插值的硬视觉提示下的3D开放词汇实例分割
计算机视觉与模式识别
2025-04-22 v1
摘要
视觉语言模型(VLM)在图像级视觉感知任务中展现出惊人的零样迁移能力。然而,它们在需要精确局部化和识别单个物体的3D实例分割任务中表现不足。为弥合这一差距,我们引入一种新方法,基于3D高斯溶解的硬视觉提示,利用相机插值生成围绕目标对象的多样化视角,无需任何2D-3D优化或微调。该方法模拟真实的3D视角,有效丰富了现有硬视觉提示的几何一致性,从而增强目标对象的描述性特征,使VLM能够在多样化的3D场景中实现更稳健和准确的3D实例分割。
引用
@article{arxiv.2504.14638,
title = {NVSMask3D: Hard Visual Prompting with Camera Pose Interpolation for 3D Open Vocabulary Instance Segmentation},
author = {Junyuan Fang and Zihan Wang and Yejun Zhang and Shuzhe Wang and Iaroslav Melekhov and Juho Kannala},
journal= {arXiv preprint arXiv:2504.14638},
year = {2025}
}
备注
15 pages, 4 figures, Scandinavian Conference on Image Analysis 2025