中文

基于自适应技能分布的目标探索用于目标条件强化学习

机器学习 2024-04-22 v1 人工智能

摘要

探索效率在目标条件强化学习 (GCRL) 任务中构成重大挑战,尤其是在长时序和稀疏奖励的情况下。探索效率的一个主要限制在于智能体无法利用环境的结构模式。在本研究中,我们引入了一个新框架 GEASD,旨在通过学习过程中的自适应技能分布来捕捉这些模式。该分布优化上下文时域内已实现目标的局部熵,增强目标扩散行为,并促进在包含熟悉结构模式的状态中进行深度探索。我们的实验表明,与均匀技能分布相比,使用自适应技能分布在探索效率上有显著提升。此外,学习到的技能分布展现出强大的泛化能力,在包含相似局部结构的未见任务中取得了实质性的探索进展。

关键词

引用

@article{arxiv.2404.12999,
  title  = {Goal Exploration via Adaptive Skill Distribution for Goal-Conditioned Reinforcement Learning},
  author = {Lisheng Wu and Ke Chen},
  journal= {arXiv preprint arXiv:2404.12999},
  year   = {2024}
}