中文

交替优化与求积法用于鲁棒控制

机器学习 2017-12-19 v3 人工智能 机器学习

摘要

贝叶斯优化已成功应用于多种强化学习问题。然而,在模拟器中学习最优策略的传统方法并未利用通过调整某些环境变量来改进学习的机会:这些状态特征在物理环境中不可观测且由环境随机决定,但在模拟器中是可控的。本文考虑在考虑环境变量影响的情况下寻找鲁棒策略的问题。我们提出交替优化与求积法(ALOQ),该方法使用贝叶斯优化和贝叶斯求积来解决此类场景。ALOQ 对显著稀有事件的存在具有鲁棒性,这些事件在随机采样下可能不可观测,但在决定最优策略中起着重要作用。跨不同领域的实验结果表明,ALOQ 比现有方法能更高效、更鲁棒地学习。

关键词

引用

@article{arxiv.1605.07496,
  title  = {Alternating Optimisation and Quadrature for Robust Control},
  author = {Supratik Paul and Konstantinos Chatzilygeroudis and Kamil Ciosek and Jean-Baptiste Mouret and Michael A. Osborne and Shimon Whiteson},
  journal= {arXiv preprint arXiv:1605.07496},
  year   = {2017}
}

备注

To appear in AAAI 2018. Video of policy learnt in simulation deployed on a real hexapod see https://youtu.be/ME90xtIPsKk