中文

探索潜在状态聚类的边缘:面向目标条件强化学习

机器学习 2024-11-05 v1 人工智能 机器人学

摘要

在无监督目标条件强化学习中,高效地探索未知环境是根本性挑战。虽然在先前探索状态的边界选择探索性目标是有效策略,但训练期间的策略可能仍具有 limited capability of reaching rare goals on the frontier,导致探索行为受限。我们提出 "Cluster Edge Exploration" (CE2CE^2),一种新的以目标为导向的探索算法,该算法在选择稀疏探索区域的目标时优先选择 remain accessible to the agent 的目标状态。关键思想是聚类以在潜在空间中对当前策略下容易相互到达的状态进行分组,并在这些聚类边界上具有显著探索潜力的状态上进行遍历,然后进行探索行为。在包括多足蹼蹼蹼机器人导航迷宫、在杂乱桌面上操作机器人机械臂以及在拟人化机器人手掌中旋转物体的挑战性机器人环境中,CE2CE^2 在探索效率上优于基线方法和 ablation。

关键词

引用

@article{arxiv.2411.01396,
  title  = {Exploring the Edges of Latent State Clusters for Goal-Conditioned Reinforcement Learning},
  author = {Yuanlin Duan and Guofeng Cui and He Zhu},
  journal= {arXiv preprint arXiv:2411.01396},
  year   = {2024}
}

备注

NeurIPS2024 Poster