在潜在重尾梯度下实现更好的可扩展性
机器学习
2020-12-16 v2 机器学习
摘要
我们研究了一种可扩展的鲁棒梯度下降(RGD)技术的替代方案,可用于梯度可能重尾的情况,尽管学习者对此未知。核心技术很简单:我们不是在每个步骤尝试鲁棒地聚合梯度(这代价高昂并导致风险界中次优的维度依赖),而是选择一个与在划分数据上单次遍历运行的多个廉价随机子过程的大多数偏离不太远的候选。除形式化保证外,我们还提供了在亚高斯和重尾数据下对实验条件扰动的鲁棒性的实证分析。结果是一个易于实现、可平凡并行化的过程,它保持了 RGD 方法的形式化优势,但更好地扩展到大型学习问题。
引用
@article{arxiv.2006.00784,
title = {Better scalability under potentially heavy-tailed gradients},
author = {Matthew J. Holland},
journal= {arXiv preprint arXiv:2006.00784},
year = {2020}
}
备注
This paper has been superseded by arXiv:2012.07346 (a merge and extension of this article and arXiv:2006.01364)