通过逐层学习率改进迁移学习中的知识蒸馏
机器学习
2024-07-09 v1 计算机视觉与模式识别
摘要
当学习任务的复杂度增加时,迁移学习方法开始表现不佳。大多数这些方法计算所有匹配特征的累积差异,然后使用这些差异通过所有层反向传播该损失。与这些方法相反,在本工作中,我们提出了一种新颖的逐层学习方案,该方案根据输出激活相对于网络参数的雅可比/注意力/海森矩阵的差异,逐层调整学习参数。我们将这种新颖方案应用于基于注意力图和基于导数(一阶和二阶)的迁移学习方法。我们在广泛的数据集上获得了改进的学习性能和稳定性。通过广泛的实验评估,我们观察到,随着学习任务难度的增加,我们的方法所实现的性能提升变得更加显著。
引用
@article{arxiv.2407.04871,
title = {Improving Knowledge Distillation in Transfer Learning with Layer-wise Learning Rates},
author = {Shirley Kokane and Mostofa Rafid Uddin and Min Xu},
journal= {arXiv preprint arXiv:2407.04871},
year = {2024}
}