中文

通过逐层学习率改进迁移学习中的知识蒸馏

机器学习 2024-07-09 v1 计算机视觉与模式识别

摘要

当学习任务的复杂度增加时,迁移学习方法开始表现不佳。大多数这些方法计算所有匹配特征的累积差异,然后使用这些差异通过所有层反向传播该损失。与这些方法相反,在本工作中,我们提出了一种新颖的逐层学习方案,该方案根据输出激活相对于网络参数的雅可比/注意力/海森矩阵的差异,逐层调整学习参数。我们将这种新颖方案应用于基于注意力图和基于导数(一阶和二阶)的迁移学习方法。我们在广泛的数据集上获得了改进的学习性能和稳定性。通过广泛的实验评估,我们观察到,随着学习任务难度的增加,我们的方法所实现的性能提升变得更加显著。

关键词

引用

@article{arxiv.2407.04871,
  title  = {Improving Knowledge Distillation in Transfer Learning with Layer-wise Learning Rates},
  author = {Shirley Kokane and Mostofa Rafid Uddin and Min Xu},
  journal= {arXiv preprint arXiv:2407.04871},
  year   = {2024}
}