基于行列式点过程的无监督技能发现统一算法框架
机器学习
2023-09-27 v3
摘要
在选项(option)框架下无需外部奖励监督而学习丰富技能处于强化学习研究的前沿。现有工作主要落入两个截然不同的类别:通过互信息损失最大化选项多样性的变分选项发现(却忽略覆盖度),以及通过增加状态空间连通性来改善选项覆盖度的基于拉普拉斯的方法(却忽略多样性)。本文中,我们证明无监督选项发现中的多样性与覆盖度确实可在同一数学框架下统一。具体而言,我们通过行列式点过程(DPP)的新颖使用来显式量化所学选项的多样性与覆盖度,并优化这些目标以发现兼具优越多样性与覆盖度的选项。我们提出的算法 ODPP 已在基于 Mujoco 与 Atari 构建的挑战性任务上经过广泛评估。结果表明,我们的算法在多样性驱动与覆盖度驱动两类方法中均优于最先进的基线。
引用
@article{arxiv.2212.00211,
title = {A Unified Algorithm Framework for Unsupervised Discovery of Skills based on Determinantal Point Process},
author = {Jiayu Chen and Vaneet Aggarwal and Tian Lan},
journal= {arXiv preprint arXiv:2212.00211},
year = {2023}
}
备注
This paper is accepted by NeurIPS 2023