开放词表域适应:面向 2D 和 3D 分割的 OpenDAS
计算机视觉与模式识别
2024-10-31 v4
摘要
最近,视觉语言模型 (VLM) 通过从传统的封闭式预定义对象类别分割转向开放词表分割 (OVS),允许用户对在分割模型训练期间未见过的新类别和概念进行分割。然而,这种灵活性伴随着权衡:完全监督的封闭式方法在基准类别上仍然优于 OVS 方法,即在它们明确训练的类别上。这源于 VLM 缺乏像素对齐的训练掩码(它们在图像-字幕对上进行训练),以及缺乏特定于领域的知识,如自动驾驶。因此,我们提出了开放词表域适应任务,以将特定于领域的知识注入 VLM,同时保持其开放词表特性。通过这种方式,我们在基准和新类别上实现了更好的性能。现有 VLM 适应方法在基准 (训练) 查询上改进性能,但未能完全保留 VLM 在新查询上的开放集能力。为此,我们结合参数高效提示调优与基于三元组损失的训练策略,后者使用辅助负查询。值得注意的是,我们的方法是唯一能够在新类别上持续超越原始 VLM 的参数高效方法。Our adapted VLMs can seamlessly be integrated into existing OVS pipelines, e.g., improving OVSeg by +6.0% mIoU on ADE20K for open-vocabulary 2D segmentation, and OpenMask3D by +4.1% AP on ScanNet++ Offices for open-vocabulary 3D instance segmentation without other changes. The project page is available at https://open-das.github.io/.
引用
@article{arxiv.2405.20141,
title = {OpenDAS: Open-Vocabulary Domain Adaptation for 2D and 3D Segmentation},
author = {Gonca Yilmaz and Songyou Peng and Marc Pollefeys and Francis Engelmann and Hermann Blum},
journal= {arXiv preprint arXiv:2405.20141},
year = {2024}
}