基于视觉语言模型的不一致分类学下的跨域语义分割
计算机视觉与模式识别
2024-08-06 v1
摘要
语义分割在无监督域适应(Unsupervised Domain Adaptation, UDA)中的挑战,不仅源于源域与目标域图像之间的域迁移,还源于跨域类别分类学之间的差异。传统的UDA研究假设源域和目标域之间存在一致的分类学,从而限制了其识别和适应目标域分类学的能力。本文引入了一种新方法,称为跨域语义分割在不一致分类学上使用视觉语言模型(Cross-Domain Semantic Segmentation on Inconsistent Taxonomy using Vision Language Models, 简称CSI),有效地在源-目标类别不匹配的情况下进行域适应语义分割。CSI利用视觉语言模型(Vision Language Models, VLMs)的语义泛化潜力,与先前的UDA方法形成协同作用。它结合通过传统UDA方法获得的分割推理与VLMs中嵌入的丰富语义知识,用于重新标注目标域中的新类别。该方法允许在无需目标域任何 ground truth 标签的情况下,适应扩展后的分类学。我们的 метод在不一致分类学设置下(粗到细分类学和开放分类学)表现出色,并在集成到先前SOTA UDA方法时展现出持久的协同效应。实现代码已公开于 http://github.com/jkee58/CSI。
引用
@article{arxiv.2408.02261,
title = {Cross-Domain Semantic Segmentation on Inconsistent Taxonomy using VLMs},
author = {Jeongkee Lim and Yusung Kim},
journal= {arXiv preprint arXiv:2408.02261},
year = {2024}
}
备注
ECCV 2024