DiCE:无限可微的蒙特卡洛估计器
机器学习
2018-11-07 v3 人工智能
神经与进化计算
摘要
得分函数估计器被广泛用于估计随机计算图(SCG)中随机目标函数的梯度,例如在强化学习和元学习中。虽然通过微分替代损失(SL)目标来推导一阶梯度估计器在计算和概念上都很简单,但将相同方法用于高阶导数则更具挑战性。首先,解析推导并实现此类估计器十分繁琐,且不符合自动微分。其次,反复应用SL为每个阶数的导数构造新目标涉及日益繁琐的图操作。最后,为了与微分下的一阶梯度匹配,SL将部分代价视为固定样本,我们证明这会导致高阶导数估计器出现缺失和错误的项。为了以统一方式解决所有这些缺陷,我们提出了DiCE,它提供单一目标,可重复微分,生成SCG中任意阶导数估计器的正确估计。与SL不同,DiCE依赖自动微分来执行必要的图操作。我们通过证明和对DiCE导数估计的数值评估验证了DiCE的正确性。我们还使用DiCE提出并评估了一种用于多智能体学习的新方法。我们的代码可在 https://www.github.com/alshedivat/lola 获取。
引用
@article{arxiv.1802.05098,
title = {DiCE: The Infinitely Differentiable Monte-Carlo Estimator},
author = {Jakob Foerster and Gregory Farquhar and Maruan Al-Shedivat and Tim Rocktäschel and Eric P. Xing and Shimon Whiteson},
journal= {arXiv preprint arXiv:1802.05098},
year = {2018}
}