人工神经网络学习动力学的相变:含与不含错标数据
机器学习
2021-01-19 v1 统计力学
数据分析、统计与概率
摘要
尽管深度神经网络在机器学习中取得了巨大成功,但其卓越学习能力的根本原因仍不清楚。在此,我们提出一个基于统计物理的框架来研究驱动神经网络学习的随机梯度下降(SGD)动力学。通过使用小批量梯度系综,我们构造序参量来刻画SGD中权重更新的动力学。在没有错标数据的情况下,我们发现SGD学习动力学从快速学习相转变为缓慢探索相,这与刻画SGD梯度对齐及其平均幅度的序参量的大幅变化相关。在含有随机错标样本的情况下,SGD学习动力学落入四个不同的相。系统首先在相I中找到正确标注样本的解,随后在相II中围绕这些解游荡,直到在相III中找到学习错标样本的方向,之后在相IV中找到满足所有训练样本的解。相应地,测试误差在相I中下降并在相II中保持较低;然而,它在相III中上升并在相IV中达到高平台期。不同相之间的转变可通过刻画正确与错误标注样本平均梯度对齐及其在学习过程中(相对)强度的序参量的变化来理解。我们发现两个数据集上的个体样本损失在相II中分离最明显,这导致了一种清洗过程以消除错标样本从而改善泛化。
引用
@article{arxiv.2101.06509,
title = {Phases of learning dynamics in artificial neural networks: with or without mislabeled data},
author = {Yu Feng and Yuhai Tu},
journal= {arXiv preprint arXiv:2101.06509},
year = {2021}
}