中文

基于自然语言监督改进视觉微调

计算机视觉与模式识别 2023-08-16 v2

摘要

微调视觉预训练模型可利用大规模预训练数据中的语义信息,并缓解下游视觉任务在训练样本有限时的过拟合问题。尽管预训练主干网络在微调中的灾难性遗忘问题已被广泛研究,但其源自相应预训练任务与数据的潜在偏置却较少受到关注。本文通过证明微调后所得分类器将接近于预训练模型诱导的分类器,来探究该问题。为有效降低分类器中的偏置,我们引入由固定文本分类器获得的参考分布,以正则化所学视觉分类器。所提方法——文本监督微调(TeS)——在 11 个下游任务上,使用包括 ResNet 和 ViT 在内的多种预训练视觉模型以及包括 BERT 和 CLIP 在内的文本编码器进行了评估。在不同场景下的一致且明显的改进印证了我们所提方法的有效性。代码见 \url{https://github.com/idstcv/TeS}。

关键词

引用

@article{arxiv.2304.01489,
  title  = {Improved Visual Fine-tuning with Natural Language Supervision},
  author = {Junyang Wang and Yuanhong Xu and Juhua Hu and Ming Yan and Jitao Sang and Qi Qian},
  journal= {arXiv preprint arXiv:2304.01489},
  year   = {2023}
}

备注

accepted by ICCV'23