面向分布式强化学习的多样本目标值探索
机器学习
2022-02-08 v1 人工智能
摘要
分布式强化学习(RL)旨在学习一个价值网络,用于预测给定状态下回报的完整分布,通常基于分位数 critic 建模。该方法已成功集成到常见的连续控制RL方法中,催生了如分布式软演员-评论家(DSAC)等算法。本文为分布式RL引入多样本目标值(MTV),作为对当前实践中常用的单样本目标值估计的原则性替代。改进后的分布估计进一步适用于基于UCB的探索。将这两个思想结合得到了我们的分布式RL算法E2DC(基于分布评论家的额外探索)。我们在一系列连续控制任务上评估了该方法,并在Humanoid控制等困难任务上展示了最先进的免模型性能。我们通过可视化及对所学习分布及其在训练过程中演变的分析,进一步揭示了该方法的内在机理。
引用
@article{arxiv.2202.02693,
title = {Exploration with Multi-Sample Target Values for Distributional Reinforcement Learning},
author = {Michael Teng and Michiel van de Panne and Frank Wood},
journal= {arXiv preprint arXiv:2202.02693},
year = {2022}
}
备注
Submitted to ICML 2022