离线技能发现的贝叶斯非参数方法
机器学习
2022-06-24 v3 人工智能
机器学习
摘要
强化学习中的技能或底层策略是时间上扩展的动作,可以加速学习并实现复杂行为。近期在离线强化学习和模仿学习方面的工作提出了几种从一组专家轨迹中发现技能的技术。尽管这些方法很有前景,但要发现的技能数量 K 始终是一个固定的超参数,这需要关于环境的先验知识或额外的参数搜索来调整。我们首先提出了一种利用变分推断和连续松弛进展的选项(一种特定的技能框架)离线学习方法。然后,我们揭示了贝叶斯非参数方法与离线技能发现之间一个未被探索的联系,并展示了如何获得我们模型的非参数版本。由于精心构造的近似后验具有动态变化的选项数量,该版本易于处理,从而无需指定 K。我们还展示了我们的非参数扩展如何应用于其他技能框架,并通过实验证明,我们的方法在多种环境中可以优于最先进的离线技能学习算法。我们的代码可在 https://github.com/layer6ai-labs/BNPO 获取。
引用
@article{arxiv.2202.04675,
title = {Bayesian Nonparametrics for Offline Skill Discovery},
author = {Valentin Villecroze and Harry J. Braviner and Panteha Naderian and Chris J. Maddison and Gabriel Loaiza-Ganem},
journal= {arXiv preprint arXiv:2202.04675},
year = {2022}
}
备注
Accepted at ICML 2022