单任务多场景强化学习的动态价值估计
机器学习
2020-05-26 v1 人工智能
机器学习
摘要
在来自同一任务的多个关卡/场景/条件的环境中训练深度强化学习智能体,已成为许多旨在实现从仿真到现实世界的泛化与域迁移的应用的关键。尽管这种策略有助于泛化,但多场景的使用显著增加了用于策略梯度计算的采样方差。当前方法仍将该场景集合视为具有公共价值函数的单一马尔可夫决策过程(MDP);然而,我们认为更好地将其视为具有多个潜在 MDP 的单一环境。为此,受不同场景中价值函数分布所观察到的聚类效应启发,我们针对这些多 MDP 环境提出了一种动态价值估计(DVE)技术。所得智能体能够学习更准确且场景特定的价值函数估计(进而得到优势函数),从而降低采样方差。我们提出的方法易于与若干现有实现(如 PPO、A3C)结合,并在一系列 ProcGen 环境和基于 AI2-THOR 框架的视觉导航任务中取得了一致的改进。
引用
@article{arxiv.2005.12254,
title = {Dynamic Value Estimation for Single-Task Multi-Scene Reinforcement Learning},
author = {Jaskirat Singh and Liang Zheng},
journal= {arXiv preprint arXiv:2005.12254},
year = {2020}
}