PLATO:基于自适应轨迹优化的策略学习
机器学习
2017-02-28 v4
摘要
策略搜索原则上可以获取用于控制机器人及其他自主系统的复杂策略。当策略被训练以处理原始感官输入(如图像和深度图)时,它还能获得结合感知与控制的策略。然而,有效处理此类复杂输入需要具有表现力的策略类,例如大型神经网络。这些高维策略难以训练,尤其在学控安全关键系统时。我们提出PLATO,一种利用监督学习训练复杂控制策略的算法,其使用模型预测控制(MPC)生成监督信号,因此无需运行部分训练且潜在不安全的策略。PLATO采用自适应训练方法修改MPC的行为,使其逐渐匹配所学策略,从而在所学策略可能访问的状态处生成训练样本。PLATO还将MPC代价作为目标,以避免在策略完全训练前严格遵循所学策略而导致的极不期望的动作。我们证明这类自适应MPC专家产生的监督能带来所得策略良好的长视野性能。我们还通过经验证明,在训练过程中MPC仍能在意外情况下避免危险的on-policy动作。我们在一组具有挑战性的模拟飞行器任务上的经验结果表明,与先前方法相比,PLATO学习更快,训练期间经历的灾难性失败(坠毁)显著更少,且常收敛到更好的策略。
引用
@article{arxiv.1603.00622,
title = {PLATO: Policy Learning using Adaptive Trajectory Optimization},
author = {Gregory Kahn and Tianhao Zhang and Sergey Levine and Pieter Abbeel},
journal= {arXiv preprint arXiv:1603.00622},
year = {2017}
}