中文

SAMURAI:用于3D物体识别的形状感知多模态检索

计算机视觉与模式识别 2025-06-27 v1

摘要

在复杂的室内环境中,仅使用掩码2D图像和自然语言描述来检索3D物体面临重大挑战。ROOMELSA挑战限制了完整3D场景上下文的获取,使得对物体外观、几何形状和语义的推理变得复杂。畸变的视角、无纹理的掩码区域、含糊的语言提示以及有噪声的分割掩码进一步加剧了这些挑战。为了解决这些问题,我们提出了SAMURAI:用于3D物体识别的形状感知多模态检索。SAMURAI将基于CLIP的语义匹配与从掩码区域的二值轮廓导出的形状引导重排序相结合,并采用了鲁棒的多数投票策略。专用的预处理流水线通过提取最大连通分量和去除背景噪声来增强掩码质量。我们的混合检索框架同时利用了语言和形状线索,在ROOMELSA私有测试集上取得了有竞争力的性能。这些结果突显了将形状先验与语言理解相结合对于鲁棒的开放世界3D物体检索的重要性。

关键词

引用

@article{arxiv.2506.21056,
  title  = {SAMURAI: Shape-Aware Multimodal Retrieval for 3D Object Identification},
  author = {Dinh-Khoi Vo and Van-Loc Nguyen and Minh-Triet Tran and Trung-Nghia Le},
  journal= {arXiv preprint arXiv:2506.21056},
  year   = {2025}
}