中文

一种基于后继表示的边缘化重要性采样深度强化学习方法

机器学习 2023-11-15 v2 人工智能 机器学习

摘要

边缘化重要性采样(MIS)衡量目标策略与采样分布的状态-动作占用率之间的密度比,是一种有前景的离线策略评估方法。然而,当前最先进的 MIS 方法依赖复杂的优化技巧,且主要在简单玩具问题上取得成功。我们通过观察到密度比可由目标策略的后继表示计算得出,从而弥合了 MIS 与深度强化学习之间的差距。后继表示可通过深度强化学习方法训练,并将奖励优化与环境动态解耦,使所得算法稳定且适用于高维领域。我们在多种具有挑战性的 Atari 和 MuJoCo 环境中评估了我们方法的经验性能。

关键词

引用

@article{arxiv.2106.06854,
  title  = {A Deep Reinforcement Learning Approach to Marginalized Importance Sampling with the Successor Representation},
  author = {Scott Fujimoto and David Meger and Doina Precup},
  journal= {arXiv preprint arXiv:2106.06854},
  year   = {2023}
}

备注

ICML 2021