中文

基于自由能范式与状态聚合的子目标发现

机器学习 2025-02-11 v2 人工智能

摘要

强化学习(RL)在解决复杂的序列决策任务中发挥着重要作用。层次化强化学习和目标条件化强化学习是两种处理RL中两个主要问题——样本效率低下和奖励设计困难——的有前景的方法。这两种方法通过将任务分解为更简单的子任务并在动作空间中进行时间抽象化来解决上述问题。这些方法的一个关键组成部分是子目标发现。我们可以利用子目标状态来定义动作层次结构,也可用于分解复杂任务。在子目标状态更不可预测的假设下,我们提出一种自由能范式来发现子目标。这通过使用自由能在主空间和聚合空间之间进行选择来实现。模型从相邻状态变化到给定状态的变化显示了该状态的不可预测性,因此本文将其用于子目标发现。我们的实验结果在网格世界等导航任务上表明,所提出的方法无需任务先验知识即可用于子目标发现。我们提出的方法对环境的随机性也具有鲁棒性。

关键词

引用

@article{arxiv.2412.16687,
  title  = {Subgoal Discovery Using a Free Energy Paradigm and State Aggregations},
  author = {Amirhossein Mesbah and Reshad Hosseini and Seyed Pooya Shariatpanahi and Majid Nili Ahmadabadi},
  journal= {arXiv preprint arXiv:2412.16687},
  year   = {2025}
}