工业环境中基于开放词汇的 3D 场景感知
计算机视觉与模式识别
2026-02-24 v1
摘要
生产、仓储物流或制造环境中的自主视觉应用需要超越小型固定类别集合的感知能力。最近的开放词汇方法利用 2D 视觉语言基础模型(VLFM)针对这一任务,但常常依赖于针对非工业数据集(例如家庭场景)预训练的类别无关分割模型。在本工作中,我们首先演示了此类模型难以泛化,在常见工业物体上性能较差。因此,我们提出一种无训练的开放词汇 3D 感知管道,以克服这一限制。我们的 method simply generates masks by merging pre-computed superpoints based on their semantic features。随后,我们对 domain-adapted VLFM "IndustrialCLIP" 在代表性 3D 工业车间场景上进行开放词汇查询评估。我们的定性结果表明,成功分割了工业物体。
引用
@article{arxiv.2602.19823,
title = {Open-vocabulary 3D scene perception in industrial environments},
author = {Keno Moenck and Adrian Philip Florea and Julian Koch and Thorsten Schüppstuhl},
journal= {arXiv preprint arXiv:2602.19823},
year = {2026}
}