中文

CAQL:连续动作 Q-learning

机器学习 2020-03-03 v3 人工智能 机器学习

摘要

基于价值的强化学习(RL)方法如 Q-learning 已在多种领域取得成功。然而,将 Q-learning 应用于连续动作 RL 问题的一个挑战在于最优 Bellman 备份所需的连续动作最大化(max-Q)。在本工作中,我们开发了 CAQL,一类用于连续动作 Q-learning 的算法,其可对 max-Q 问题使用若干即插即用的优化器。借助近期关于深度神经网络的优化结果,我们证明 max-Q 可通过混合整数规划(MIP)最优求解。当 Q 函数表示具有足够表达能力时,基于 MIP 的优化能带来更优策略,并且比近似方法(如梯度上升、交叉熵搜索)更鲁棒。我们进一步开发了若干加速 CAQL 推理的技术,尽管具有近似性质,仍表现良好。我们在具有不同动作约束程度的基准连续控制问题上将 CAQL 与最先进 RL 算法比较,表明 CAQL 在强约束环境中优于基于策略的方法,且往往优势显著。

关键词

引用

@article{arxiv.1909.12397,
  title  = {CAQL: Continuous Action Q-Learning},
  author = {Moonkyung Ryu and Yinlam Chow and Ross Anderson and Christian Tjandraatmadja and Craig Boutilier},
  journal= {arXiv preprint arXiv:1909.12397},
  year   = {2020}
}