一种基于后继表示的边缘化重要性采样深度强化学习方法
机器学习
2023-11-15 v2 人工智能
机器学习
摘要
边缘化重要性采样(MIS)衡量目标策略与采样分布的状态-动作占用率之间的密度比,是一种有前景的离线策略评估方法。然而,当前最先进的 MIS 方法依赖复杂的优化技巧,且主要在简单玩具问题上取得成功。我们通过观察到密度比可由目标策略的后继表示计算得出,从而弥合了 MIS 与深度强化学习之间的差距。后继表示可通过深度强化学习方法训练,并将奖励优化与环境动态解耦,使所得算法稳定且适用于高维领域。我们在多种具有挑战性的 Atari 和 MuJoCo 环境中评估了我们方法的经验性能。
引用
@article{arxiv.2106.06854,
title = {A Deep Reinforcement Learning Approach to Marginalized Importance Sampling with the Successor Representation},
author = {Scott Fujimoto and David Meger and Doina Precup},
journal= {arXiv preprint arXiv:2106.06854},
year = {2023}
}
备注
ICML 2021