似然比与重参数化梯度的统一视角
机器学习
2021-06-01 v1 人工智能
机器学习
摘要
重参数化(RP)和似然比(LR)梯度估计器被用于机器学习与强化学习中期望梯度的估计;然而,它们通常仅被解释为简单的数学技巧,对其本质缺乏洞察。我们采用第一性原理方法解释,LR 与 RP 是追踪概率质量移动的两种替代方法,且二者通过散度定理相连。此外,我们表明,结合 LR 与 RP 的所有可能估计器之空间可由流场 和重要度采样分布 完全参数化。我们证明,在我们所刻画的空间之外不可能存在此类单样本估计器,从而厘清了寻找更优蒙特卡洛梯度估计器的搜索范围。
引用
@article{arxiv.2105.14900,
title = {A unified view of likelihood ratio and reparameterization gradients},
author = {Paavo Parmas and Masashi Sugiyama},
journal= {arXiv preprint arXiv:2105.14900},
year = {2021}
}
备注
AISTATS2021; Earlier paper was split in two (arXiv:1910.06419). Refer to the current paper for the unified view, but see the earlier paper for discussion on an importance sampling technique