理解过参数化神经网络分类器训练中的平方损失
机器学习
2021-12-08 v1 机器学习
摘要
深度学习已在现代分类任务中取得诸多突破。针对不同的数据结构已提出众多架构,但就损失函数而言,交叉熵损失仍是主导选择。近来,若干替代损失在深度分类器中重新受到关注。特别是,经验证据似乎推崇平方损失,但尚缺乏理论依据。本工作中,我们通过对过参数化神经网络在神经切线核(NTK) regime下表现的系统考察,增进对分类中平方损失的理论理解。我们揭示了有关泛化误差、鲁棒性和校准误差的有趣性质。我们根据类别是否可分离考虑两种情况。在一般不可分离情形下,误分类率和校准误差均建立了快速收敛速率。当类别可分离时,误分类率改进为指数级快速。进一步,所得间隔被证明有远离零的下界,为鲁棒性提供了理论保证。我们期望我们的发现超越NTK regime而成立,并迁移至实际设置。为此,我们在实用神经网络上进行了广泛实证研究,展示了平方损失在合成低维数据和真实图像数据中的有效性。与交叉熵相比,平方损失具有相当的泛化误差,但在鲁棒性和模型校准方面有显著优势。
引用
@article{arxiv.2112.03657,
title = {Understanding Square Loss in Training Overparametrized Neural Network Classifiers},
author = {Tianyang Hu and Jun Wang and Wenjia Wang and Zhenguo Li},
journal= {arXiv preprint arXiv:2112.03657},
year = {2021}
}