面向提示学习的视觉语言模型时代
计算机视觉与模式识别
2024-11-08 v1
摘要
大规模基础模型如CLIP展示出强大的零样态泛化能力,但在域移情况方面表现不足,限制了其可适应性。本文引入textsc{StyLIP},一种用于域泛化(Domain Generalization, DG)的新型域无关提示学习策略。StyLIP通过使用风格投影器将CLIP视觉编码器中的视觉风格与内容解耦,从而学习域特定的提示标记并与内容特征组合。经过对比学习训练,这种方法实现了跨域的无缝适应, 在多个DG基准上 outperform state-of-the-art方法。此外,我们提出AD-CLIP用于无监督域适应(Domain Adaptation, DA),利用CLIP冻结的视觉主干学习通过图像风格和内容特征获得域无关提示。通过在嵌入空间中对齐域并进行熵最小化,AD-CLIP有效处理域移,即使仅有目标域样本也能工作。最后,我们概述了未来工作,即利用提示学习进行遥感语义分割中的类发现,专注于识别非结构环境中新出现的或稀有的类。这为在复杂真实场景中构建更具适应性和可泛化性的模型指明了方向。
引用
@article{arxiv.2411.04892,
title = {In the Era of Prompt Learning with Vision-Language Models},
author = {Ankit Jha},
journal= {arXiv preprint arXiv:2411.04892},
year = {2024}
}
备注
ICVGIP 2024, Young Faculty Symposium