基于预训练技能的稀疏奖励长程目标条件强化学习目标探索增强
机器学习
2023-12-20 v2 人工智能
机器人学
摘要
强化学习(RL)常难以在复杂环境中完成稀疏奖励长程任务。目标条件强化学习(GCRL)已通过易达子目标的课程来解决这一难题。在GCRL中,探索新颖子目标对智能体最终找到通往期望目标的路径至关重要。如何高效探索新颖子目标是GCRL中最具挑战性的问题之一。已有若干目标探索方法提出以应对此问题,但仍难以高效找到期望目标。本文中,我们提出一种新颖的学习目标,通过优化已达成目标与待探索新目标的熵,在基于子目标选择的GCRL中实现更高效的目标探索。为优化该目标,我们首先探索并利用在当前任务相似环境中挖掘的频繁目标转移模式,通过技能学习组合成技能。随后,预训练技能被应用于目标探索。在多种稀疏奖励长程基准任务上的评估表明,将我们的方法融入若干最先进GCRL基线可显著提升其探索效率,同时改善或保持性能。源代码见:https://github.com/GEAPS/GEAPS。
引用
@article{arxiv.2210.16058,
title = {Goal Exploration Augmentation via Pre-trained Skills for Sparse-Reward Long-Horizon Goal-Conditioned Reinforcement Learning},
author = {Lisheng Wu and Ke Chen},
journal= {arXiv preprint arXiv:2210.16058},
year = {2023}
}
备注
Accepted for publication in Machine Learning (Springer): 35 pages, 15 figures