中文

穿越动态小批量子采样损失函数的噪声:可视化指南

机器学习 2020-04-07 v2 机器学习

摘要

由于数据需求增长、图形处理单元(GPU)等内存受限的计算资源以及在线学习的动态特性,神经网络训练中的小批量子采样不可避免。本研究明确区分了静态小批量子采样损失函数(其中小批量在训练中间歇性固定,导致平滑但有偏的损失函数)与动态子采样等价情形(每次损失评估时重新采样小批量,以偏差换取采样引发不连续性的方差)。这些使得最小化线搜索等自动优化策略失效,因为临界点可能不存在,且函数最小化器会找到由不连续性引发的伪极小值。本文建议将优化问题重构为寻找随机非负关联梯度投影点(SNN-GPPs)。我们证明 SNN-GPP 最优性准则比临界点或最小化器更不易受子采样引发的不连续性影响。我们进行了一项可视化研究,在简单神经网络训练问题的损失函数中,针对多种常用激活函数比较局部极小值与 SNN-GPP 最优性准则。由于 SNN-GPP 能更好地逼近真实最优值的位置,尤其在使用具有高曲率特征的平滑激活函数时,我们推测定位 SNN-GPP 的线搜索可显著促进神经网络训练的自动化。

关键词

引用

@article{arxiv.1903.08552,
  title  = {Traversing the noise of dynamic mini-batch sub-sampled loss functions: A visual guide},
  author = {Dominic Kafka and Daniel Wilke},
  journal= {arXiv preprint arXiv:1903.08552},
  year   = {2020}
}

备注

43 pages, 22 Figures, to be submitted to a journal