中文

连续 MDP 规划中深度反应策略的采样高效迭代下界优化

人工智能 2022-03-25 v1 机器学习

摘要

深度学习的近期进展使得能够通过将参数化策略编码为深度神经网络并在端到端基于模型的梯度下降框架中利用自动微分,来优化用于连续 MDP 规划的深度反应策略(DRPs)。该方法在非线性连续 MDP 中优化 DRP 已被证明有效,但它需要大量采样轨迹才能有效学习,且解质量可能存在高方差。本工作中,我们重新审视整体的基于模型的 DRP 目标,转而采用极小化-极大化视角,迭代地针对局部紧致的下界目标优化 DRP。这种将 DRP 学习表述为迭代下界优化(ILBO)的新颖形式尤其具有吸引力,因为(i)每步在结构上比整体目标更易优化,(ii)在特定理论条件下保证目标单调改善,且(iii)它在迭代间复用样本从而降低采样复杂度。实证评估证实,ILBO 比最先进的 DRP 规划器显著更具采样高效性,并持续产生更优解质量且方差更低。我们还证明 ILBO 能很好地泛化到新问题实例(即不同初始状态)而无需重新训练。

关键词

引用

@article{arxiv.2203.12679,
  title  = {Sample-efficient Iterative Lower Bound Optimization of Deep Reactive Policies for Planning in Continuous MDPs},
  author = {Siow Meng Low and Akshat Kumar and Scott Sanner},
  journal= {arXiv preprint arXiv:2203.12679},
  year   = {2022}
}