中文

匹配学习率下注意力漂移与微调CLIP迁移保持的分析

机器学习 2026-04-21 v1

摘要

CLIP适应化可以提高准域内准确率,同时损害准域外迁移,但在全参数微调(Full FT)与LoRA之间进行的比较常常受到不同学习率惯例的混淆。我们研究了适应方法和优化规模如何联合影响CLIP中注意力漂移和迁移保持,使用受控的匹配学习率比较Full FT与LoRA。该完成矩阵包含80次在CLIP ViT-B/32上运行的实验,覆盖EuroSAT和Oxford-IIIT Pets数据集,spanning four shared learning rates (10610^{-6}, 5×1065{\times}10^{-6}, 10510^{-5}, 5×1055{\times}10^{-5}) and five seeds,并评估注意力漂移指标、最佳验证准确率和适配器感知的CIFAR-100零样本准确率。在EuroSAT上,Full FT从10610^{-6}处的轻微熵展宽,移动到5×1055{\times}10^{-5}处的显著收缩,而LoRA在整个匹配网格上保持正熵。在匹配学习率下,LoRA保留的零样本迁移显著优于Full FT,在EuroSAT上平均为45.13%45.13\% vs 11.28%11.28\%的CIFAR-100准确率,Oxford-IIIT Pets上为58.01%58.01\% vs 8.54%8.54\%。Oxford-IIIT Pets也揭示了一种 regime效应:低学习率LoRA在准域内欠拟合,因此方法仅的平均值会掩盖LoRA何时变得有竞争力。支持性的 rollout、patch-to-patch和CKA分析在受控矩阵中方向一致。总体而言,匹配学习率评估在Full FT与LoRA的解释中产生实质性变化,而注意力漂移作为表示保持的描述性诊断工具比作为迁移行为因果解释更有用。

关键词

引用

@article{arxiv.2604.16410,
  title  = {Matched-Learning-Rate Analysis of Attention Drift and Transfer Retention in Fine-Tuned CLIP},
  author = {Ruize Xia},
  journal= {arXiv preprint arXiv:2604.16410},
  year   = {2026}
}