受 MPC 启发的用于序贯决策神经网络策略
机器学习
2018-03-15 v2
摘要
本文中,我们研究受 MPC 启发的神经网络策略在序贯决策中的使用。我们引入对 DAgger 算法的扩展以训练此类策略,并展示它们如何改善训练性能与泛化能力。我们利用该扩展展示了在连续状态与动作空间中对复杂规划策略架构的可扩展且高效的训练。我们通过考虑前馈策略、循环策略以及受路径积分控制框架启发的带规划结构的循环策略,对神经网络策略进行了广泛比较。我们的结果表明,MPC 型循环策略对扰动与建模误差具有更好的鲁棒性。
引用
@article{arxiv.1802.05803,
title = {MPC-Inspired Neural Network Policies for Sequential Decision Making},
author = {Marcus Pereira and David D. Fan and Gabriel Nakajima An and Evangelos Theodorou},
journal= {arXiv preprint arXiv:1802.05803},
year = {2018}
}
备注
Fixed missing reference to section 4.1