中文

EVaDE:用于基于模型强化学习的基于事件的变分 Thompson 采样

机器学习 2025-01-17 v1

摘要

强化学习后验采样是一种著名的算法,它通过 Thompson 采样增强基于模型的强化学习(MBRL)算法。PSRL 维持环境转移动力学和奖励函数的后验分布,这对于具有高维状态和动作空间的任务来说是难以处理的。最近的工作表明,与神经网络结合使用的 dropout 会引发能够近似这些后验的变分分布。在本文中,我们提出了用于探索的基于事件的变分分布,这是一种对 MBRL 非常有用的变分分布,尤其是当底层领域是基于对象的时。我们利用基于对象领域的一般领域知识,设计了三种类型的基于事件的卷积层来引导探索。这些层依赖于 Gaussian dropout,并被插入到深度神经网络模型的各层之间,以帮助促进变分 Thompson 采样。我们在 100K Atari 游戏套件上经验性地展示了配备 EVaDE 的模拟策略学习(EVaDE-SimPLe)的有效性。

关键词

引用

@article{arxiv.2501.09611,
  title  = {EVaDE : Event-Based Variational Thompson Sampling for Model-Based Reinforcement Learning},
  author = {Siddharth Aravindan and Dixant Mittal and Wee Sun Lee},
  journal= {arXiv preprint arXiv:2501.09611},
  year   = {2025}
}