中文

神经网络的通用循环训练

机器学习 2025-01-17 v2 人工智能 计算机视觉与模式识别 机器学习

摘要

本文描述了机器学习中“通用循环训练”的原理,即训练以“容易训练”开始和结束,“困难训练”发生在中间轮次。我们提出了训练神经网络的几种表现形式,包括算法示例(通过超参数和损失函数)、基于数据的示例和基于模型的示例。具体而言,我们引入了几种新技术:循环权重衰减、循环批量大小、循环 focal loss、循环 softmax 温度、循环数据增强、循环梯度裁剪和循环半监督学习。此外,我们证明了循环权重衰减、循环 softmax 温度和循环梯度裁剪(作为该原理的三个示例)对训练模型的测试准确率性能有益。进一步,我们从通用循环训练的角度讨论基于模型的示例(如预训练和知识蒸馏),并对典型训练方法提出一些改进建议。总之,本文定义了通用循环训练概念,并讨论了该概念可应用于神经网络训练的几种具体方式。为可复现起见,我们实验中使用的代码可在 \url{https://github.com/lnsmith54/CFL} 获取。

关键词

引用

@article{arxiv.2202.08835,
  title  = {General Cyclical Training of Neural Networks},
  author = {Leslie N. Smith},
  journal= {arXiv preprint arXiv:2202.08835},
  year   = {2025}
}

备注

Position paper