中文

面向强化学习的混合优化与程序合成

机器学习 2018-07-05 v2 人工智能 机器学习

摘要

深度强化学习已取得若干近期突破,尽管所学策略通常基于黑盒神经网络。这使其难以解释,且难以在学习过程中施加所需的规范约束。我们提出一种迭代框架 MORL,利用程序合成改进所学策略。具体而言,我们建议使用合成技术获得所学策略的符号表示,随后可通过程序修复手动或自动调试该表示。修复步骤后,我们使用行为克隆获得对应于修复后程序的策略,进而通过梯度下降进一步优化。此过程持续进行,直至所学策略满足期望约束。我们在简单的 CartPole 问题上实例化 MORL,并展示程序化表示支持高层修改,进而带来策略学习的改进。

关键词

引用

@article{arxiv.1807.00403,
  title  = {Towards Mixed Optimization for Reinforcement Learning with Program Synthesis},
  author = {Surya Bhupatiraju and Kumar Krishna Agrawal and Rishabh Singh},
  journal= {arXiv preprint arXiv:1807.00403},
  year   = {2018}
}

备注

Updated publication details, format. Accepted at NAMPI workshop, ICML '18