中文

基于单一视觉语言嵌入的域适应

计算机视觉与模式识别 2024-10-30 v1 机器学习

摘要

域适应在计算机视觉中得到了广泛研究,但仍需要在训练时访问目标数据,这在某些不寻常条件下可能难以获得。本文提出了一种新框架进行域适应,依赖于单个视觉语言(VL)潜在嵌入,而无需完整的目标数据。首先,利用对比语言-图像预训练模型(CLIP),我们提出了基于提示/照片驱动的实例归一化(PIN)。PIN 是一种特征增强方法,通过优化低层源特征的仿射变换,从单个目标 VL 潜在嵌入中挖掘多个视觉风格。VL 嵌入可以来自描述目标域的语言提示、部分优化的语言提示,或来自单个未标记目标图像。其次,我们表明这些挖掘的风格(即增强)可用于零样(即目标无)和单样本无监督域适应。在语义分割实验中,本文的方法在零样本和单样本设置下均优于相关基线方法。

关键词

引用

@article{arxiv.2410.21361,
  title  = {Domain Adaptation with a Single Vision-Language Embedding},
  author = {Mohammad Fahes and Tuan-Hung Vu and Andrei Bursuc and Patrick Pérez and Raoul de Charette},
  journal= {arXiv preprint arXiv:2410.21361},
  year   = {2024}
}

备注

Under review