域提示学习:高效地将 CLIP 适配到未见域
计算机视觉与模式识别
2022-08-18 v4
摘要
域泛化(DG)是一个困难的迁移学习问题,旨在为未见域学习一个可泛化的模型。最近的基座模型(FMs)对许多分布偏移具有鲁棒性,因此应能显著提高 DG 的性能。在这项工作中,我们研究了在图像分类的 DG 问题中采用视觉-语言基座模型 CLIP 的通用方法。虽然在使用标准 DG 基准测试时,经验风险最小化(ERM)通过更大的骨干网络和训练数据集极大地提高了准确率,但在许多实际情况下,微调 FMs 并不实用。我们提出域提示学习(DPL)作为一种以条件提示生成为形式进行域推断的新颖方法。DPL 仅通过训练一个轻量级的提示生成器(一个三层 MLP),其参数量与先前 DG 文献中的分类投影器规模相当,就实现了显著的准确率提升。将 DPL 与 CLIP 结合使用提供了令人惊讶的性能,在几个标准数据集(即 PACS、VLCS、OfficeHome 和 TerraIncognita)上将零样本 CLIP 的准确率从 73.7% 提高到 79.3%。我们希望我们方法的简单性和成功能够促进基座模型在域泛化领域得到更广泛的采用和分析。我们的代码可在 https://github.com/shogi880/DPLCLIP 获取。
引用
@article{arxiv.2111.12853,
title = {Domain Prompt Learning for Efficiently Adapting CLIP to Unseen Domains},
author = {Xin Zhang and Shixiang Shane Gu and Yutaka Matsuo and Yusuke Iwasawa},
journal= {arXiv preprint arXiv:2111.12853},
year = {2022}
}