通过技能区域差异化实现无监督技能发现
机器学习
2025-06-18 v1
摘要
无监督强化学习旨在发现能够加速下游任务学习的多样化行为。以熵为基础的探索或基于赋能的技能学习通常是所需方法,但熵为基础的探索在大规模状态空间(如图像)中困难,赋能方法的相互信息估计在状态探索方面存在局限。为此,我们提出一种新颖的技能发现目标函数,通过最大化单个技能状态密度与其他技能已探索区域之间的偏差,鼓励技能间的状态多样性,类似于初始的相互信息目标。对于状态密度估计,我们构建了一种用于高维空间中不同技能策略的软模块化的条件自编码器。同时,为激励技能内部探索,我们基于所学习的自编码器构建了基于计数的内在奖励,类似于紧凑潜在空间中的计数探索。在具有挑战性的状态和图像任务中进行的广泛实验表明,我们的方法学习到有意义的技能,并在各种下游任务中实现了卓越的性能。
引用
@article{arxiv.2506.14420,
title = {Unsupervised Skill Discovery through Skill Regions Differentiation},
author = {Ting Xiao and Jiakun Zheng and Rushuai Yang and Kang Xu and Qiaosheng Zhang and Peng Liu and Chenjia Bai},
journal= {arXiv preprint arXiv:2506.14420},
year = {2025}
}