ReLU 模型下梯度方法何时收敛到最大间隔分类器?
机器学习
2018-10-17 v2 机器学习
摘要
我们研究梯度下降方法在线性可分数据集上求解二分类问题时的隐式偏置。分类器由非线性 ReLU 模型描述,目标函数采用指数损失函数。我们首先刻画损失函数的景观,并表明除渐近全局极小外还可能存在伪渐近局部极小。接着我们证明,在一般情形下,梯度下降(GD)可收敛到全局或局部最大间隔方向,也可能偏离期望的最大间隔方向。对于随机梯度下降(SGD),我们证明若 SGD 收敛,则其依期望收敛到全局或局部最大间隔方向。我们进一步探讨了这些算法在特定平稳条件下学习多神经元网络时的隐式偏置,并表明所学分类器在 ReLU 激活下最大化每个样本模式划分的间隔。
引用
@article{arxiv.1806.04339,
title = {When Will Gradient Methods Converge to Max-margin Classifier under ReLU Models?},
author = {Tengyu Xu and Yi Zhou and Kaiyi Ji and Yingbin Liang},
journal= {arXiv preprint arXiv:1806.04339},
year = {2018}
}