中文

面向分类任务的视觉 Transformer 基础模型中层归一化精调的利用

计算机视觉与模式识别 2025-08-12 v1 机器学习

摘要

层归一化 (LayerNorm) 在视觉 Transformer (ViT) 中至关重要,但其在数据稀缺和域迁移情况下的精调动力学仍未得到充分探讨。本文表明,精调后 LayerNorm 参数的偏移 (LayerNorm shifts) 反映了源域向目标域的转换;其有效性取决于目标训练样本是否准确代表目标域,这由我们提出的细化偏移比率 (FSRFSR) 量化。基于此,我们提出一种简单而有效的缩放机制,引入标量 λ\lambda 其与 FSRFSR 呈负相关,用于将学习到的 LayerNorm 偏移对齐至在完全代表性数据下获得的理想偏移,并结合循环框架进一步提升 LayerNorm 精调。广泛的实验覆盖自然图像和病理图像,分别在分布内 (ID) 和分布外 (OOD) 场景下进行,涵盖各种目标训练样本规模。实验结果表明,OOD 任务通常产生较低的 FSRFSR 和较高的 λ\lambda,尤其在数据稀缺时更为明显,表明目标训练样本存在欠表示。此外,基于病理数据进行精调的 ViT 在细节上更类似于 ID 设置,倾向于保守的 LayerNorm 更新。我们的发现阐明了 LayerNorm 在迁移学习中的潜在动力学,为 LayerNorm 精调提供了实用策略。

关键词

引用

@article{arxiv.2508.07577,
  title  = {Exploiting Layer Normalization Fine-tuning in Visual Transformer Foundation Models for Classification},
  author = {Zhaorui Tan and Tan Pan and Kaizhu Huang and Weimiao Yu and Kai Yao and Chen Jiang and Qiufeng Wang and Anh Nguyen and Xin Guo and Yuan Cheng and Xi Yang},
  journal= {arXiv preprint arXiv:2508.07577},
  year   = {2025}
}