基于自适应技能分布的目标探索用于目标条件强化学习
机器学习
2024-04-22 v1 人工智能
摘要
探索效率在目标条件强化学习 (GCRL) 任务中构成重大挑战,尤其是在长时序和稀疏奖励的情况下。探索效率的一个主要限制在于智能体无法利用环境的结构模式。在本研究中,我们引入了一个新框架 GEASD,旨在通过学习过程中的自适应技能分布来捕捉这些模式。该分布优化上下文时域内已实现目标的局部熵,增强目标扩散行为,并促进在包含熟悉结构模式的状态中进行深度探索。我们的实验表明,与均匀技能分布相比,使用自适应技能分布在探索效率上有显著提升。此外,学习到的技能分布展现出强大的泛化能力,在包含相似局部结构的未见任务中取得了实质性的探索进展。
引用
@article{arxiv.2404.12999,
title = {Goal Exploration via Adaptive Skill Distribution for Goal-Conditioned Reinforcement Learning},
author = {Lisheng Wu and Ke Chen},
journal= {arXiv preprint arXiv:2404.12999},
year = {2024}
}