基于分布式重要性采样的SGD方差缩减
机器学习
2016-04-19 v7 机器学习
摘要
人类能够通过选择最具信息量且难度适当的训练材料来加速学习。我们提出一种分布式深度学习框架,其中一组工人并行搜索最具信息量的样本,而单个工人使用重要性采样选出的样本更新模型。这使得模型使用梯度的无偏估计进行更新,并且当采样提议与梯度的L2范数成比例时该估计具有最小方差。我们通过实验表明,即使在跨机器同步成本不可忽略、且重要性采样因子未在训练集上即时更新的情况下,该方法仍能降低梯度方差。
引用
@article{arxiv.1511.06481,
title = {Variance Reduction in SGD by Distributed Importance Sampling},
author = {Guillaume Alain and Alex Lamb and Chinnadhurai Sankar and Aaron Courville and Yoshua Bengio},
journal= {arXiv preprint arXiv:1511.06481},
year = {2016}
}