中文

细调深度轮廓的分解分析

机器学习 2026-04-21 v1

摘要

细调是将预训练网络适应到新目标的常用方法。是否将所得深度 representational change 概念轮廓反映为模型的内在属性,还是源于梯度流的幅度,尚未直接测试。我们测量了该轮廓在 240 次细调运行中跨越 15 个模型、4 个架构族(编码器和解码器变压器、状态空间模型和 RNN)以及从 125M 到 6.9B 参数的尺度下的表征变化。标准训练运行中,除了一次情况之外,表征变化在输出靠近的层中集中。我们应用一种每层控制机制,在每个优化步骤后均等化 ΔW/W\|\Delta W\|/\|W\| 跨层。该控制下,部分条件下的轮廓仍持续,而在其他条件下则消失。在 125M--350M 规模下,顺序块架构(BERT、OPT、GPT-2)在测试到的各种目标之间保留该斜率,而并行块架构(Pythia、CodeGen)仅在因果语言模型目标中保留。这种架构差异在 1.3B--1.4B 规模处趋于一致,两种块类型均显示出正的 equal-step 斜率,用于 CausalLM。在标准训练下,轮廓形状由两个额外轴描述:陡峭度跟踪训练自由目标距离在初始化时的程度,轮廓宽度主要由架构决定。我们将局部梯度——表征变化的深度斜率——视为一种复合现象,其组成部分随尺度而异。

关键词

引用

@article{arxiv.2604.17177,
  title  = {Decomposing the Depth Profile of Fine-Tuning},
  author = {Jayadev Billa},
  journal= {arXiv preprint arXiv:2604.17177},
  year   = {2026}
}

备注

25 pages incl. 13 appendix pages. 1 figure, 19 tables