中文

似然比与重参数化梯度的统一视角及一种最优重要性采样方案

机器学习 2019-10-16 v1 机器学习

摘要

重参数化(RP)与似然比(LR)梯度估计器在机器学习和强化学习中广泛应用;然而,它们通常仅被解释为简单的数学技巧,而未阐明其本质。我们采用第一性原理方法解释LR与RP,并通过散度定理揭示二者之间的联系。该理论促使我们推导用于降低LR梯度方差的最优重要性采样方案。我们新推导出的分布具有解析概率密度且可直接采样。对于高斯目标分布,改进幅度有限;但对于Beta分布等其他分布,我们的方法可带来任意大的改进,并且在进化策略实验中成为取得有竞争力性能的关键。

关键词

引用

@article{arxiv.1910.06419,
  title  = {A unified view of likelihood ratio and reparameterization gradients and an optimal importance sampling scheme},
  author = {Paavo Parmas and Masashi Sugiyama},
  journal= {arXiv preprint arXiv:1910.06419},
  year   = {2019}
}

备注

8 pages + 19 pages appendix. Preliminary work