模型重编程在文本-图像编码器的分布外数据上优于微调
机器学习
2024-04-02 v2
摘要
在评估预训练模型迁移到下游任务时的性能时,必须不仅评估下游模型在分布内(ID)上的准确率,还要评估其对协变量漂移(covariate shift)下的分布外(OOD)样本的泛化能力和识别能力。在本文中,我们揭示了侵入性微调技术的隐性成本。具体而言,我们表明常用的微调方法不仅扭曲了必要用于泛化到协变量漂移OOS样本(OOD generalization)的表示,还扭曲了必要用于检测语义漂移OOS样本(OOD detection)的表示。为解决这些挑战,我们引入一种新的模型重编程方法进行微调,称为Reprogrammer。Reprogrammer旨在提升下游模型在ID、OOD generalization和OOD detection任务中的整体性能。我们的实证证据表明,Reprogrammer更不侵入性,能产生更优的下游模型。此外,我们证明,通过在Reprogrammer中追加一个额外的表示残差连接,我们可以进一步保留预训练表示,从而构建一个更安全、更稳健的下游模型,能够在众多ID分类、OOD generalization和OOD detection场景中卓越表现。
引用
@article{arxiv.2403.10800,
title = {Model Reprogramming Outperforms Fine-tuning on Out-of-distribution Data in Text-Image Encoders},
author = {Andrew Geng and Pin-Yu Chen},
journal= {arXiv preprint arXiv:2403.10800},
year = {2024}
}
备注
Accepted in SatML 2024