中文

用于微调视觉语言模型的任务残差方法

计算机视觉与模式识别 2023-03-27 v2

摘要

在十亿级数据上预训练的大规模视觉语言模型(VLMs)已学习到通用的视觉表征和广泛的视觉概念。原则上,当VLMs被迁移到数据有限的下游任务时,其良好学习的知识结构应被适当地继承。然而,现有大多数针对VLMs的高效迁移学习(ETL)方法要么破坏先验知识,要么过度偏向先验知识,例如提示微调(PT)丢弃了预训练的文本分类器并重新构建一个,而适配器式微调(AT)完全依赖预训练特征。为此,我们提出一种名为任务残差微调(TaskRes)的VLMs高效微调新方法,该方法直接在基于文本的分类器上操作,并显式解耦预训练模型的先验知识与关于目标任务的新知识。具体而言,TaskRes保持VLMs的原始分类器权重冻结,并通过微调一组与先验无关的参量作为原始分类器的残差,为目标任务获得一个新分类器,从而实现可靠的先验知识保留与灵活的任务特定知识探索。所提出的TaskRes简单而有效,在11个基准数据集上显著优于先前的ETL方法(如PT和AT),且实现代价极小。我们的代码发布于 https://github.com/geekyutao/TaskRes。

关键词

引用

@article{arxiv.2211.10277,
  title  = {Task Residual for Tuning Vision-Language Models},
  author = {Tao Yu and Zhihe Lu and Xin Jin and Zhibo Chen and Xinchao Wang},
  journal= {arXiv preprint arXiv:2211.10277},
  year   = {2023}
}

备注

Accepted to CVPR 2023