中文

基于稀疏动态价值估计增强场景特异性

机器学习 2020-11-26 v1 机器学习

摘要

多场景强化学习涉及在同一任务下跨多个场景/关卡训练 RL 智能体,并已成为许多泛化应用的基础。然而,多场景的引入会导致策略梯度计算的样本方差增大,通常致使直接应用传统方法(如 PPO、A3C)时性能次优。一种方差缩减策略是将每个场景视为不同的马尔可夫决策过程(MDP)并学习依赖于状态(s)与 MDP(M)的联合价值函数。但这并非易事,因为在多场景 RL 中智能体在训练/测试时通常并不知道底层关卡。最近,Singh 等人 [1] 试图通过提出一种动态价值估计方法来解决此问题,该方法将真实联合价值函数分布建模为高斯混合模型(GMM)。在本文中,我们认为一旦智能体探索了大部分状态空间,通过逐步施加强制稀疏聚类分配,可进一步减小真实场景特定价值函数与预测动态估计之间的误差。所得智能体不仅在一系列 OpenAI ProcGen 环境中显示出最终奖励分数的显著提升,而且在完成游戏关卡时表现出更高的导航效率。

关键词

引用

@article{arxiv.2011.12574,
  title  = {Enhanced Scene Specificity with Sparse Dynamic Value Estimation},
  author = {Jaskirat Singh and Liang Zheng},
  journal= {arXiv preprint arXiv:2011.12574},
  year   = {2020}
}