中文

用于深度学习的带赌博机采样的 Adam

机器学习 2020-10-27 v1 机器学习

摘要

Adam 是一种广泛用于训练深度学习模型的优化方法。它为不同参数计算各自的自适应学习率。在本文中,我们提出 Adam 的一个推广,称为 Adambs,它使我们也能根据训练样本对模型收敛的重要性来适应不同的训练样本。为此,我们在所有样本上维持一个分布,在每次迭代中依据该分布采样选取一个小批量,并使用多臂赌博机算法更新该分布。这确保了更有助于模型训练的样本以更高概率被采样。我们从理论上证明 Adambs 改善了 Adam 的收敛速率——在某些情况下为 O(lognT)O(\sqrt{\frac{\log n}{T} }) 而非 O(nT)O(\sqrt{\frac{n}{T}})。在各种模型和数据集上的实验证明了 Adambs 在实践中的快速收敛。

关键词

引用

@article{arxiv.2010.12986,
  title  = {Adam with Bandit Sampling for Deep Learning},
  author = {Rui Liu and Tianyi Wu and Barzan Mozafari},
  journal= {arXiv preprint arXiv:2010.12986},
  year   = {2020}
}

备注

Accepted to NeurIPS 2020 as spotlight presentation