基于深度神经网络与 logistic 损失的分类
机器学习
2024-04-23 v2 机器学习
摘要
使用 logistic 损失(即交叉熵损失)训练的深度神经网络(DNN)在各种二分类任务中取得了令人印象深刻的进展。然而,针对使用 DNN 与 logistic 损失的二分类的泛化分析仍然匮乏。logistic 损失目标函数的无界性是推导满意泛化界的主要障碍。在本文中,我们旨在通过建立一种新颖而优雅的 oracle 型不等式来填补这一空白,它使我们能够处理目标函数的有界性限制,并借此推导使用 logistic 损失训练的完全连接 ReLU DNN 分类器的尖锐收敛速率。特别地,我们仅要求数据的条件类概率 的 Hölder 光滑性,便获得了最优收敛速率(至多相差对数因子)。此外,我们考虑一种复合假设,要求 为若干向量值函数的复合,其中每个分量函数或是最大值函数,或是仅依赖于其输入变量中少数的 Hölder 光滑函数。在此假设下,我们推导出与数据输入维数无关的(至多相差对数因子的)最优收敛速率。该结果解释了为何 DNN 分类器能在实际高维分类问题中表现良好。除新颖的 oracle 型不等式外,本文给出的尖锐收敛速率也得益于 ReLU DNN 在零附近(此处无界)逼近自然对数函数的紧误差界。另外,我们通过证明相应的极小极大下界来印证我们所提速率的最优性主张。所有这些结果在文献中均为新的,并将深化我们对 DNN 分类的理论理解。
引用
@article{arxiv.2307.16792,
title = {Classification with Deep Neural Networks and Logistic Loss},
author = {Zihan Zhang and Lei Shi and Ding-Xuan Zhou},
journal= {arXiv preprint arXiv:2307.16792},
year = {2024}
}