中文

基于概率模型的高效任务泛化元强化学习

机器学习 2024-02-08 v2 机器人学

摘要

我们提出了 PACOH-RL,一种新颖的基于模型的元强化学习(Meta-RL)算法,旨在将控制策略高效地适应于变化的动力学。PACOH-RL 对动力学模型的先验进行元学习,从而以最少的交互数据快速适应新动力学。现有的 Meta-RL 方法需要大量元学习数据,限制了它们在诸如机器人等数据获取成本高昂的场景中的适用性。为此,PACOH-RL 在元学习和任务适应阶段均引入了正则化与认知不确定性量化。面对新动力学时,我们利用这些不确定性估计来有效引导探索与数据收集。总体而言,这实现了正向迁移,即便在来自先前任务或动力学设置的数据极度受限时也是如此。我们的实验结果表明,PACOH-RL 在适应新动力学条件方面优于基于模型的 RL 与基于模型的 Meta-RL 基线。最后,我们在一辆真实机器人小车上展示了在多样化、数据稀缺条件下高效 RL 策略适应的潜力。

关键词

引用

@article{arxiv.2311.07558,
  title  = {Data-Efficient Task Generalization via Probabilistic Model-based Meta Reinforcement Learning},
  author = {Arjun Bhardwaj and Jonas Rothfuss and Bhavya Sukhija and Yarden As and Marco Hutter and Stelian Coros and Andreas Krause},
  journal= {arXiv preprint arXiv:2311.07558},
  year   = {2024}
}