中文

子目标树——一种基于目标的强化学习框架

人工智能 2020-12-22 v2 机器学习 机器人学

摘要

许多人工智能问题,在机器人及其他领域中,是基于目标的,本质上寻求通向各种目标状态的轨迹。强化学习(RL)建立在Bellman最优方程之上,自然地为单一目标进行优化,但可以通过用目标扩充状态而变为多目标。相反,我们提出了一种新的RL框架,推导自全点对最短路径(APSP)问题的动态规划方程,其自然地解决多目标查询。我们表明该方法对标准和近似动态规划均具有计算优势。有趣的是,我们的公式规定了一种计算轨迹的新协议:不同于标准RL中由其前驱预测下一状态,基于目标的轨迹通过首先预测起点与终点之间的中间状态、将轨迹划分为两段来构建。然后递归地预测每个子段上的中间点,直到获得完整轨迹。我们称此轨迹结构为子目标树。在此基础上,我们进一步将策略梯度方法扩展为递归预测子目标,从而得到新颖的基于目标的算法。最后,我们将我们的方法应用于神经运动规划,在7自由度机械臂避障导航上相比标准RL展示了显著改进。

关键词

引用

@article{arxiv.2002.12361,
  title  = {Sub-Goal Trees -- a Framework for Goal-Based Reinforcement Learning},
  author = {Tom Jurgenson and Or Avner and Edward Groshev and Aviv Tamar},
  journal= {arXiv preprint arXiv:2002.12361},
  year   = {2020}
}

备注

ICML2020, 8 pages, 10 figures. arXiv admin note: text overlap with arXiv:1906.05329