中文

多目标强化学习中分层目标条件策略规划的提出

人工智能 2025-01-06 v1 机器学习

摘要

人形机器人必须掌握具有稀疏奖励的众多任务,这对强化学习(RL)构成了挑战。我们提出了一种结合 RL 和自动规划的方法来解决这一问题。我们的方法使用分层组织的短目标条件策略,并利用 Monte Carlo Tree Search (MCTS) 进行使用高级动作的规划。规划过程生成的是 HLA 而非原始动作。在智能体生命周期内维护的单个规划树保存了关于目标实现的知识。这种层次结构通过重用 HLA 和预测未来动作,提高了样本效率并加速了推理。我们的分层目标条件策略规划(HGCPP)框架独特地集成了 GCP、MCTS 和分层 RL,有望改善复杂任务中的探索和规划。

关键词

引用

@article{arxiv.2501.01727,
  title  = {Proposing Hierarchical Goal-Conditioned Policy Planning in Multi-Goal Reinforcement Learning},
  author = {Gavin B. Rens},
  journal= {arXiv preprint arXiv:2501.01727},
  year   = {2025}
}

备注

10 pages, 4 figures, this is a preprint of the peer-reviewed version published by SCITEPRESS for ICAART-2025