中文

基于随机潜表示的安全像素强化学习

机器学习 2022-10-06 v1 人工智能

摘要

我们解决从像素观测进行安全强化学习的问题。此类设置中的固有挑战是:(1)奖励优化与遵守安全约束之间的权衡,(2)部分可观测性,以及(3)高维观测。我们在一个受限的部分可观测马尔可夫决策过程框架中形式化该问题,其中智能体获得独立的奖励与安全信号。为应对维度灾难,我们采用一种使用随机潜 actor-critic(SLAC)方法的新颖安全评论家。潜变量模型预测奖励与安全违规,并利用安全评论家训练安全策略。借助知名基准环境,我们在计算需求、最终奖励回报以及满足安全约束方面展示了相对于现有方法的竞争性性能。

关键词

引用

@article{arxiv.2210.01801,
  title  = {Safe Reinforcement Learning From Pixels Using a Stochastic Latent Representation},
  author = {Yannick Hogewind and Thiago D. Simao and Tal Kachman and Nils Jansen},
  journal= {arXiv preprint arXiv:2210.01801},
  year   = {2022}
}