PIPPS:对混沌诅咒鲁棒的基于模型的灵活策略搜索
机器学习
2019-02-06 v1 人工智能
机器人学
机器学习
摘要
此前,梯度爆炸问题被解释为深度学习和基于模型的强化学习中的核心问题,因为它导致优化中的数值问题和不稳定性。我们在基于模型的强化学习中的实验表明,该问题不仅是数值问题,还可能由长链非线性计算的根本类混沌性质引起。不仅梯度的幅值变大,梯度的方向也变得基本随机。我们展示重参数化梯度受该问题影响,而似然比梯度是鲁棒的。利用我们的见解,我们开发了基于模型的策略搜索框架,即基于粒子的策略搜索的概率推断(PIPPS),它易于扩展,并允许几乎任意的模型和策略,同时与先前数据高效学习算法的性能相匹配。最后,我们发明了总传播算法,该算法在单次反向传播中高效计算所有路径wise导数深度的并集,自动给予方差较小的估计量更大权重,有时比重参数化梯度改进 倍。
引用
@article{arxiv.1902.01240,
title = {PIPPS: Flexible Model-Based Policy Search Robust to the Curse of Chaos},
author = {Paavo Parmas and Carl Edward Rasmussen and Jan Peters and Kenji Doya},
journal= {arXiv preprint arXiv:1902.01240},
year = {2019}
}
备注
ICML 2018