上下文感知鲁棒微调
计算机视觉与模式识别
2022-11-30 v1
摘要
对比语言-图像预训练(CLIP)模型具有零样本分类图像是否属于“[CLASS]”的能力,通过使用图像与提示句“a [CONTEXT] of [CLASS]”之间的相似度。基于“[CONTEXT]”中详尽的文本线索,CLIP 模型能感知不同上下文,例如背景、风格、视角,并展现出对广泛分布偏移前所未有的鲁棒性。然而,近期工作发现对 CLIP 模型的进一步微调可提高准确率但牺牲了下游任务上的鲁棒性。我们进行实证调查以表明微调会破坏预训练 CLIP 特征的上下文感知能力。为解决此问题,我们提出上下文感知鲁棒微调(CAR-FT)。CAR-FT 在微调过程中正则化模型以捕获上下文信息。具体而言,我们使用零样本提示权重来获取图像中包含的上下文分布。通过最小化原始/微调 CLIP 模型诱导的上下文分布之间的 Kullback-Leibler 散度(KLD),CAR-FT 使 CLIP 的上下文感知能力继承到下游任务中,并实现更高的分布内(ID)和分布外(OOD)准确率。实验结果表明 CAR-FT 在 ImageNet 的五个 OOD 测试数据集上实现了卓越的鲁棒性,同时在九个下游任务上带来准确率增益。此外,CAR-FT 超越了之前的域泛化(DG)方法,在 DomainBed 基准上获得 78.5% 的平均准确率,建立了新的最先进水平。
引用
@article{arxiv.2211.16175,
title = {Context-Aware Robust Fine-Tuning},
author = {Xiaofeng Mao and Yuefeng Chen and Xiaojun Jia and Rong Zhang and Hui Xue and Zhao Li},
journal= {arXiv preprint arXiv:2211.16175},
year = {2022}
}