中文

面向单任务多场景强化学习的稀疏注意力引导动态价值估计

机器学习 2021-02-16 v1 人工智能 机器人学 机器学习

摘要

在来自同一任务的多个关卡/场景的环境中训练深度强化学习智能体,已成为许多旨在实现从仿真到现实世界泛化与域迁移应用的关键。尽管该策略有助于泛化,多场景的使用显著增加了用于策略梯度计算的采样方差。现有方法有效地继续将此场景集合视为单一马尔可夫决策过程(MDP),从而学习场景通用价值函数V(s)。然而,我们认为多场景环境的采样方差最好通过将每个场景视为独立MDP,再学习依赖于状态s和MD P M的联合价值函数V(s,M)来最小化。我们进一步证明,多场景环境的真实联合价值函数遵循多模态分布,而传统基于CNN/LSTM的评论家网络未能捕捉该分布。为此,我们提出一种动态价值估计(DVE)技术,通过针对多个价值函数假设/模态的稀疏注意力机制来逼近真实联合价值函数。所得智能体不仅在一系列OpenAI ProcGen环境中最终奖励分数显著提升,还展现出增强的导航效率,并提供了一种无监督状态空间技能分解的隐式机制。

关键词

引用

@article{arxiv.2102.07266,
  title  = {Sparse Attention Guided Dynamic Value Estimation for Single-Task Multi-Scene Reinforcement Learning},
  author = {Jaskirat Singh and Liang Zheng},
  journal= {arXiv preprint arXiv:2102.07266},
  year   = {2021}
}

备注

This work is a merger of arXiv:2005.12254 and arXiv:2011.12574