SFP:无状态先验用于离策略强化学习中的探索
机器学习
2022-09-01 v3
摘要
高效探索是深度强化学习中的关键挑战。若干方法(如行为先验)能够利用离线数据来高效加速复杂任务上的强化学习。然而,若手头任务与示范任务偏离过大,此类方法的有效性便受限。在我们的工作中,我们提出从离线数据中学习为更广泛任务所共享的特征,例如动作与方向性之间的相关性。为此,我们引入无状态先验(state-free priors),其直接对示范轨迹中的时间一致性建模,并能在即便于更简单任务收集的数据上训练时,也可驱动复杂任务中的探索。此外,我们提出了一种在离策略强化学习中动作先验的新颖集成方案,通过从策略与动作先验的概率混合中动态采样动作。我们将我们的方法与强基线进行比较,并提供经验证据:在稀疏奖励设置下的长视野连续控制任务中,该方法可加速强化学习。
引用
@article{arxiv.2205.13528,
title = {SFP: State-free Priors for Exploration in Off-Policy Reinforcement Learning},
author = {Marco Bagatella and Sammy Christen and Otmar Hilliges},
journal= {arXiv preprint arXiv:2205.13528},
year = {2022}
}
备注
Accepted by TMLR in August 2022. Project page at https://eth-ait.github.io/sfp/