VLMs meet UDA:通过无监督域适应提升开放词汇分割的迁移能力
计算机视觉与模式识别
2024-12-13 v1 人工智能
摘要
分割模型通常受训练期间定义的类别限制。为此,研究人员探索了两种独立方法:适应基于视觉语言模型(VLM)和利用合成数据。然而,VLM 往往在细粒度方面吃力,难以消解细粒度概念;而合成数据方法受限于可用数据集的范围。本文提出通过集成视觉语言推理和关键无监督域适应(UDA)策略来增强跨域分割精度。首先,我们通过多尺度上下文数据、稳健文本嵌入(带提示增强)以及层级微调,提出了 Foundational-Retaining Open Vocabulary Semantic Segmentation(FROVSS)框架,以提高 VLM 的细粒度分割能力。随后,我们将这些增强措施纳入 UDA 框架,通过知识蒸馏稳定训练并采用跨域混合抽样以提升适应性而不损害泛化能力。得到的 UDA-FROVSS 框架是首个在无需共享类别的情况下有效跨域适应的 UDA 方法。
引用
@article{arxiv.2412.09240,
title = {VLMs meet UDA: Boosting Transferability of Open Vocabulary Segmentation with Unsupervised Domain Adaptation},
author = {Roberto Alcover-Couso and Marcos Escudero-Viñolo and Juan C. SanMiguel and Jesus Bescos},
journal= {arXiv preprint arXiv:2412.09240},
year = {2024}
}