中文

PAC-Bayes控制:学习可证明泛化至新环境的策略

机器人学 2020-08-27 v5 人工智能 机器学习 系统与控制 最优化与控制

摘要

我们的目标是在给定示例环境数据集的情况下,为机器人学习可证明良好泛化至新环境的控制策略。我们方法背后的关键技术思想是,通过利用控制策略向新环境的泛化与监督学习设定下假设泛化之间的精确类比(我们以归约的形式给出),来借助机器学习中的泛化理论工具。具体而言,我们采用可能近似正确(Probably Approximately Correct, PAC)-Bayes框架,该框架使我们能够获得以高概率成立的、关于(随机)控制策略在新环境上期望代价的上界。我们提出明确寻求最小化该上界的策略学习算法。在优化有限策略空间的设定下,相应的优化问题可使用凸优化(特别是相对熵规划)求解。在连续参数化策略(例如神经网络策略)的更一般设定中,我们使用随机梯度下降来最小化该上界。我们给出了将该方法应用于学习(1)反应式避障策略与(2)基于神经网络的抓取策略的仿真结果。我们还展示了Parrot Swing无人机穿越不同障碍环境的硬件结果。我们的示例证明了我们的方法有为具有连续状态与动作空间、复杂(例如非线性)动力学、丰富感官输入(例如深度图像)以及基于神经网络的策略的机器人系统提供强泛化保证的潜力。

关键词

引用

@article{arxiv.1806.04225,
  title  = {PAC-Bayes Control: Learning Policies that Provably Generalize to Novel Environments},
  author = {Anirudha Majumdar and Alec Farid and Anoopkumar Sonar},
  journal= {arXiv preprint arXiv:1806.04225},
  year   = {2020}
}

备注

Extended version of paper presented at the 2018 Conference on Robot Learning (CoRL)