中文

面向元强化学习的具有剧烈方差缩减的偏梯度估计

机器学习 2021-12-15 v1

摘要

尽管元强化学习(meta-RL)在经验上取得成功,理论与实践之间仍存在诸多理解不足的偏差。关键的是,实践中几乎总是采用偏梯度估计,而先前关于元强化学习的理论仅在无偏梯度估计下建立收敛性。本文研究了这一偏差。具体而言:(1)我们证明无偏梯度估计的方差为Θ(N)\Theta(N),线性依赖于内循环更新的样本量NN;(2)我们提出线性化得分函数(LSF)梯度估计,其偏差为O(1/N)\mathcal{O}(1/\sqrt{N})、方差为O(1/N)\mathcal{O}(1/N);(3)我们表明大多数先前的实证工作实际上实现了LSF梯度估计的变体,这意味着实际算法“偶然”引入偏差以取得更好性能;(4)我们针对LSF梯度估计在元强化学习中收敛至驻点建立了理论保证,当NN较大时显示出优于先前工作的对NN的依赖性。

关键词

引用

@article{arxiv.2112.07328,
  title  = {Biased Gradient Estimate with Drastic Variance Reduction for Meta Reinforcement Learning},
  author = {Yunhao Tang},
  journal= {arXiv preprint arXiv:2112.07328},
  year   = {2021}
}