Z3D:从图像实现零样本 3D 视觉 grounding
计算机视觉与模式识别
2026-02-04 v1
摘要
3D 视觉 grounding (3DVG) 旨在基于自然语言查询在 3D 场景中局部化对象。本文探索了仅从多视图图像实现零样本 3DVG,而无需任何几何监督或对象先验。我们引入 Z3D,一个通用的 grounding 流水线,可灵活地在多视图图像上运行,同时可选地集成相机姿态和深度图。我们确定了先前零样本方法中的关键瓶颈导致显著性能下降,并通过 (i) 采用最先进的零样本 3D 实例分割方法生成高质量的 3D 边界框提案,以及 (ii) 利用基于提示的分割实现高级推理,从而充分发挥现代视觉-语言模型 (VLM) 的全部能力。在 ScanRefer 和 Nr3D 基准上进行的大量实验表明,我们的方法在零样本方法中实现了业界最佳性能。代码地址为 https://github.com/col14m/z3d。
引用
@article{arxiv.2602.03361,
title = {Z3D: Zero-Shot 3D Visual Grounding from Images},
author = {Nikita Drozdov and Andrey Lemeshko and Nikita Gavrilov and Anton Konushin and Danila Rukhovich and Maksim Kolodiazhnyi},
journal= {arXiv preprint arXiv:2602.03361},
year = {2026}
}