OG:为视觉占据赋予实例分割与视觉定位能力
计算机视觉与模式识别
2023-07-13 v1
摘要
占据预测任务聚焦于对每个体素几何与语义标签的推断,是一项重要的感知任务。然而,它仍是一项不区分不同实例的语义分割任务。此外,尽管一些现有工作(如开放词汇占据(OVO))已解决开放词汇检测问题,但据我们所知,占据中的视觉定位尚未解决。为应对上述两个局限,本文提出占据定位(OG),一种新颖方法,赋予原始占据实例分割能力,并可在 grounded-SAM 的帮助下以体素方式进行视觉定位。我们方法的关键在于(1)用于实例聚类的亲和场预测,以及(2)用于对齐 2D 实例掩码与 3D 占据实例的关联策略。我们进行了大量实验,其可视化结果与分析如下所示。我们的代码将很快公开释放。
引用
@article{arxiv.2307.05873,
title = {OG: Equip vision occupancy with instance segmentation and visual grounding},
author = {Zichao Dong and Hang Ji and Weikun Zhang and Xufeng Huang and Junbo Chen},
journal= {arXiv preprint arXiv:2307.05873},
year = {2023}
}