神经网络的通用循环训练
机器学习
2025-01-17 v2 人工智能
计算机视觉与模式识别
机器学习
摘要
本文描述了机器学习中“通用循环训练”的原理,即训练以“容易训练”开始和结束,“困难训练”发生在中间轮次。我们提出了训练神经网络的几种表现形式,包括算法示例(通过超参数和损失函数)、基于数据的示例和基于模型的示例。具体而言,我们引入了几种新技术:循环权重衰减、循环批量大小、循环 focal loss、循环 softmax 温度、循环数据增强、循环梯度裁剪和循环半监督学习。此外,我们证明了循环权重衰减、循环 softmax 温度和循环梯度裁剪(作为该原理的三个示例)对训练模型的测试准确率性能有益。进一步,我们从通用循环训练的角度讨论基于模型的示例(如预训练和知识蒸馏),并对典型训练方法提出一些改进建议。总之,本文定义了通用循环训练概念,并讨论了该概念可应用于神经网络训练的几种具体方式。为可复现起见,我们实验中使用的代码可在 \url{https://github.com/lnsmith54/CFL} 获取。
引用
@article{arxiv.2202.08835,
title = {General Cyclical Training of Neural Networks},
author = {Leslie N. Smith},
journal= {arXiv preprint arXiv:2202.08835},
year = {2025}
}
备注
Position paper