Lipsum-FT:利用随机文本引导对零样本模型进行鲁棒微调
机器学习
2024-04-02 v1 计算机视觉与模式识别
摘要
大规模对比视觉-语言预训练模型提供了零样本模型,无需在下游数据上进行训练即可在一系列图像分类任务中取得具有竞争力的性能。近期的研究证实,虽然对零样本模型在参考数据上进行额外微调能提升下游性能,但这会损害模型对分布偏移的鲁棒性。我们的研究首先基于特征畸变理论和联合能量模型,考察了实现鲁棒微调目标所需的条件。随后,我们提出了一种新颖的鲁棒微调算法 Lipsum-FT,该算法有效利用了视觉-语言预训练模型中的语言建模特性。在 DomainNet 和 ImageNet 的分布偏移场景下进行的大量实验证实,我们提出的 Lipsum-FT 方法优于现有的鲁棒微调方法。
引用
@article{arxiv.2404.00860,
title = {Lipsum-FT: Robust Fine-Tuning of Zero-Shot Models Using Random Text Guidance},
author = {Giung Nam and Byeongho Heo and Juho Lee},
journal= {arXiv preprint arXiv:2404.00860},
year = {2024}
}
备注
ICLR 2024