中文

Open-RGBT:面向开放世界环境的开放词典 RGB-T 零样本语义分割

计算机视觉与模式识别 2024-10-10 v1

摘要

语义分割是有效场景理解的关键技术。传统的 RGB-T 语义分割模型由于依赖预训练模型和预定义类别,难以在多样化场景中泛化。近期视觉语言模型(VLM)的发展促进了从封闭集合向开放词典语义分割方法的转变。然而,这些模型在处理复杂场景时面临挑战,主要源于 RGB 与热力学模态之间的异质性。为此,我们提出了 Open-RGBT,一种新颖的开放词典 RGB-T 语义分割模型。具体而言,我们通过纳入视觉提示来获取实例级检测提案,以增强类别理解。此外,我们采用 CLIP 模型评估图像-文本相似度,有助于纠正语义一致性,减轻类别识别中的歧义。经验评估表明,Open-RGBT 在多样化且具挑战性的真实场景中,甚至在野外环境下,均实现了卓越的性能,显著推动了 RGB-T 语义分割领域的发展。

关键词

引用

@article{arxiv.2410.06626,
  title  = {Open-RGBT: Open-vocabulary RGB-T Zero-shot Semantic Segmentation in Open-world Environments},
  author = {Meng Yu and Luojie Yang and Xunjie He and Yi Yang and Yufeng Yue},
  journal= {arXiv preprint arXiv:2410.06626},
  year   = {2024}
}