中文

面向视觉-语言模型更新的兼容微调

计算机视觉与模式识别 2024-12-31 v1 机器学习

摘要

迄今为止,高效微调已成为通过学习即插即用模块来增强基础模型在下游任务上的能力的流行策略。然而,现有方法忽视了一个关键问题:如果底层基础模型被更新,这些即插即用模块是否仍然有效?本文首先对各种在 CLIP 上的微调方法进行了关于其与模型更新兼容性的详细分析。研究揭示了许多高性能微调方法在升级模型后无法保持兼容性。为此,我们提出了一种新方法,即基于类的上下文优化(Class-conditioned Context Optimization, ContCoOp),该方法在输入文本编码器之前将可学习的提示与类嵌入集成到注意力层中。因此,提示可以动态适应嵌入空间的变化(由于模型更新),以确保持续有效性。广泛的实验表明,我们的 ContCoOp 在基线方法之上实现了最高的兼容性,并表现出稳健的跨分布 generalization 能力。

关键词

引用

@article{arxiv.2412.20895,
  title  = {Towards Compatible Fine-tuning for Vision-Language Model Updates},
  author = {Zhengbo Wang and Jian Liang and Lijun Sheng and Ran He and Zilei Wang and Tieniu Tan},
  journal= {arXiv preprint arXiv:2412.20895},
  year   = {2024}
}

备注

preprint