中文

基于分布式重要性采样的SGD方差缩减

机器学习 2016-04-19 v7 机器学习

摘要

人类能够通过选择最具信息量且难度适当的训练材料来加速学习。我们提出一种分布式深度学习框架,其中一组工人并行搜索最具信息量的样本,而单个工人使用重要性采样选出的样本更新模型。这使得模型使用梯度的无偏估计进行更新,并且当采样提议与梯度的L2范数成比例时该估计具有最小方差。我们通过实验表明,即使在跨机器同步成本不可忽略、且重要性采样因子未在训练集上即时更新的情况下,该方法仍能降低梯度方差。

关键词

引用

@article{arxiv.1511.06481,
  title  = {Variance Reduction in SGD by Distributed Importance Sampling},
  author = {Guillaume Alain and Alex Lamb and Chinnadhurai Sankar and Aaron Courville and Yoshua Bengio},
  journal= {arXiv preprint arXiv:1511.06481},
  year   = {2016}
}