中文

神经网络学习轨迹的迁移

机器学习 2023-10-04 v2 人工智能 机器学习

摘要

训练深度神经网络(DNNs)计算代价高昂,这在模型集成或微调预训练模型等场景中重复或类似训练运行时尤为突出。一旦我们在某数据集上训练好一个 DNN,便拥有其学习轨迹(即训练过程中中间参数的序列),该轨迹可能包含用于学习该数据集的有用信息。然而,此前从未有尝试将给定学习轨迹的此类信息用于另一次训练。本文中,我们形式化地将给定学习轨迹从一个初始参数“迁移”到另一个初始参数的问题(学习迁移问题),并推导出首个通过沿轨迹利用置换对称性依次匹配梯度来近似求解该问题的算法。我们经验表明,迁移所得参数在任何直接训练之前即达到非平凡精度,且比从头训练显著更快。

关键词

引用

@article{arxiv.2305.14122,
  title  = {Transferring Learning Trajectories of Neural Networks},
  author = {Daiki Chijiwa},
  journal= {arXiv preprint arXiv:2305.14122},
  year   = {2023}
}

备注

v2: updates include theoretical analysis and additional experiments