从纯规划到纯策略及其中间地带:一种递归树规划器
机器人学
2024-05-24 v1 机器学习
摘要
递归树规划器(RTP)被设计为在一端作为纯规划器(无策略)运行,在另一端运行纯贪婪策略。介于两者之间,RTP利用策略来提高规划性能,并改善从一类规划问题到另一类问题的零样本迁移。策略通过模仿规划器来学习。然后规划器使用这些策略在良性循环中改进策略。为了提高规划性能和零样本迁移,RTP在其层次结构的任何级别将先前学习的任务作为广义动作(GA)纳入,并且还可以通过在任何级别添加原始动作来细化这些GA。对于搜索,RTP使用广义Dijkstra算法[Dijkstra 1959],该算法首先尝试贪婪策略,然后搜索近贪婪路径,必要时再搜索更远的路径。RTP可以从较低级别返回多个子目标以及障碍物附近的边界状态,并可以利用具有背景和对象数量不变性的策略。层次结构中所有级别的策略可以同时学习,也可以按任意顺序学习,或者来自框架外部。RTP在多种Box2d [Cato 2022]问题(包括经典的月球着陆器[Farama 2022])以及MuJoCo [Todorov et al 2012]倒立摆上进行了测试。
引用
@article{arxiv.2405.13130,
title = {Pure Planning to Pure Policies and In Between with a Recursive Tree Planner},
author = {A. Norman Redlich},
journal= {arXiv preprint arXiv:2405.13130},
year = {2024}
}
备注
30 pages, 15 figures, 3 tables