中文

用于强化学习的对比初始状态缓冲

机器学习 2024-02-27 v3

摘要

在强化学习中,探索与利用之间的权衡对从有限样本中实现高效学习提出了复杂挑战。尽管近期工作已能有效利用过往经验进行策略更新,却常忽视重用过往经验用于数据收集的潜力。我们独立于底层 RL 算法,引入对比初始状态缓冲(Contrastive Initial State Buffer)的概念,其从过往经验中策略性地选择状态并用它们将智能体初始化于环境中,以引导智能体走向信息更丰富的状态。我们在两项复杂机器人任务上验证了我们的方法,且不依赖任何关于环境的先验信息:(i)四足机器人穿越崎岖地形的运动,(ii)四旋翼无人机穿越赛道的竞速。实验结果表明,我们的初始状态缓冲在加快训练收敛的同时,取得了优于常规基线的任务性能。

关键词

引用

@article{arxiv.2309.09752,
  title  = {Contrastive Initial State Buffer for Reinforcement Learning},
  author = {Nico Messikommer and Yunlong Song and Davide Scaramuzza},
  journal= {arXiv preprint arXiv:2309.09752},
  year   = {2024}
}