POLTER:用于无监督强化学习的策略轨迹集成正则化
机器学习
2023-12-19 v3 机器人学
摘要
无监督强化学习(URL)的目标是在任务域上找到一个与奖励无关的先验策略,从而提升有监督下游任务的样本效率。尽管以此类先验策略初始化的智能体在下游任务微调时能用更少样本获得显著更高的奖励,但如何在实践中获得最优的预训练先验策略仍是一个开放问题。本工作中,我们提出POLTER(策略轨迹集成正则化,Policy Trajectory Ensemble Regularization)——一种对预训练进行正则化的通用方法,可应用于任意URL算法,并对基于数据与知识的URL算法尤为有用。它利用预训练期间发现的策略集成,并将URL算法的策略推向其最优先验。我们的方法基于一个理论框架,并在一个白盒基准上分析了其实际效果,从而能在完全可控的条件下研究POLTER。在主要实验中,我们在无监督强化学习基准(URLB)上评估POLTER,该基准包含3个域中的12个任务。我们通过将一组多样的基于数据与知识的URL算法的性能平均提升19%、最佳情况提升达40%,证明了方法的通用性。在与调优基线及调优POLTER的公平比较下,我们在URLB上确立了无模型方法的新SOTA。
引用
@article{arxiv.2205.11357,
title = {POLTER: Policy Trajectory Ensemble Regularization for Unsupervised Reinforcement Learning},
author = {Frederik Schubert and Carolin Benjamins and Sebastian Döhler and Bodo Rosenhahn and Marius Lindauer},
journal= {arXiv preprint arXiv:2205.11357},
year = {2023}
}