中文

双向可达层次强化学习:相互响应策略

机器学习 2024-06-27 v1 人工智能

摘要

层次强化学习 (HRL) 通过将复杂的长期任务分解为子目标来解决此问题。因此,HRL 的有效性严重依赖于子目标的可达性。典型的 HRL 方法仅考虑单向层次的子目标可达性,即主导层次强制执行从属层次的动作。然而,我们注意到当主导层次在局部探索中陷入僵局或生成不可达的子目标时,从属层次会被负面影响,无法遵循主导层次的动作。这可能会导致两个层次都陷入局部最优,从而阻碍后续子目标的可达性。允许实时双向信息共享和错误纠正是解决此问题的自然方法,这促使我们提出一种相互响应机制。基于此,我们提出了双向可达层次策略优化 (BrHPO)——一种简单而有效的算法,同时具有计算效率。在各种长期任务上的实验结果表明,BrHPO 在其他最先进的 HRL 基线方法上都表现出更好的性能,同时显著提高了探索效率和鲁棒性。

关键词

引用

@article{arxiv.2406.18053,
  title  = {Bidirectional-Reachable Hierarchical Reinforcement Learning with Mutually Responsive Policies},
  author = {Yu Luo and Fuchun Sun and Tianying Ji and Xianyuan Zhan},
  journal= {arXiv preprint arXiv:2406.18053},
  year   = {2024}
}