先定向后扩散:用于状态覆盖与目标到达的增量式无监督技能发现
机器学习
2022-05-03 v2
摘要
在无奖励条件下学习有意义的行为是强化学习中的难题。一个令人期待且具有挑战性的无监督目标是学习一组多样技能,在提供对状态空间彻底覆盖的同时具有定向性,即可靠地到达环境的各个不同区域。本文中,我们基于技能发现的互信息框架,提出 UPSIDE,通过以下方式解决覆盖—定向权衡:1)我们设计具有解耦结构的策略,包含一个经训练到达特定区域的定向技能,以及后续引发局部覆盖的扩散部分。2)我们在每个策略到达环境不同区域(即充分可区分)的约束下最大化策略数量,并证明这构成了原始互信息目标的下界。3)最后,我们将学到的定向技能组合为一棵不断生长的树,自适应覆盖环境。我们在多个导航与控制环境中展示,UPSIDE 学到的技能比现有基线更好地解决了稀疏奖励的下游任务。
引用
@article{arxiv.2110.14457,
title = {Direct then Diffuse: Incremental Unsupervised Skill Discovery for State Covering and Goal Reaching},
author = {Pierre-Alexandre Kamienny and Jean Tarbouriech and Sylvain Lamprier and Alessandro Lazaric and Ludovic Denoyer},
journal= {arXiv preprint arXiv:2110.14457},
year = {2022}
}
备注
ICLR 2022