使用 Frank-Wolfe 训练深度神经网络
机器学习
2020-10-22 v2 最优化与控制
摘要
本文研究了以条件梯度(又名 Frank-Wolfe 方法)形式使用无投影一阶方法训练参数受约束神经网络的经验效能与益处。我们既与当前最先进的随机梯度下降(Gradient Descent)方法比较,也在随机条件梯度的不同变体间进行比较。特别地,我们展示了使用 Frank-Wolfe 算法训练参数由凸可行域约束的神经网络的总体可行性,并比较了不同随机变体。随后我们表明,通过选取适当区域,可达到超越无约束随机梯度下降且匹配依赖 -正则化的最先进结果的性能。最后,我们还证明,除影响性能外,约束的特定选取会对所学表示产生剧烈影响。
引用
@article{arxiv.2010.07243,
title = {Deep Neural Network Training with Frank-Wolfe},
author = {Sebastian Pokutta and Christoph Spiegel and Max Zimmer},
journal= {arXiv preprint arXiv:2010.07243},
year = {2020}
}
备注
fixed coding error in figure 1 and extended abstract; 13 pages, Abstract 11 pages, 9 figures, 6 tables