中文

ContraBAR:对比贝叶斯自适应深度强化学习

机器学习 2023-06-06 v1 人工智能 机器学习

摘要

在元强化学习(meta RL)中,智能体寻求贝叶斯最优策略——即面对从某已知任务分布中采样得到的未知任务时的最优策略。先前的方法通过推断任务参数的信念(belief),使用变分推断方法来解决此问题。受近期对比学习方法在RL中成功应用的启发,如对比预测编码(CPC),我们探究对比方法是否可用于学习贝叶斯最优行为。我们首先证明由CPC学到的表征确实足以实现贝叶斯最优性。基于此观察,我们提出了一种简单的元RL算法,使用CPC替代变分信念推断。我们的方法ContraBAR在基于状态的观测领域中取得了与最先进(state-of-the-art)方法相当的性能,并规避了未来观测重建的计算开销,从而能够在基于图像的观测领域中学习。它也可与图像增强结合用于域随机化,并无缝用于在线与离线元RL设置。

关键词

引用

@article{arxiv.2306.02418,
  title  = {ContraBAR: Contrastive Bayes-Adaptive Deep RL},
  author = {Era Choshen and Aviv Tamar},
  journal= {arXiv preprint arXiv:2306.02418},
  year   = {2023}
}

备注

ICML 2023. Pytorch code available at https://github.com/ec2604/ContraBAR