中文

基于状态抽象的神经网络情景控制

机器学习 2023-02-21 v3 人工智能 神经与进化计算

摘要

现有深度强化学习(DRL)算法存在样本效率低的问题。一般而言,基于情景控制的方法是利用高奖励历史经验来提升DRL算法样本效率的解决方案。然而,以往的基于情景控制的方法未能利用历史行为(如状态转移、拓扑相似性等)中的潜在信息,且在DRL训练期间缺乏可扩展性。本文提出基于状态抽象的神经网络情景控制(NECSA),一种简单而有效的基于状态抽象的情景控制,包含更全面的情景记忆、新颖的状态评估以及多步状态分析。我们在OpenAI gym领域的MuJoCo和Atari任务上评估了我们的方法。实验结果表明,NECSA比最先进的基于情景控制的方法实现了更高的样本效率。我们的数据与代码可在项目网站获取\footnote{\url{https://sites.google.com/view/drl-necsa}}。

关键词

引用

@article{arxiv.2301.11490,
  title  = {Neural Episodic Control with State Abstraction},
  author = {Zhuo Li and Derui Zhu and Yujing Hu and Xiaofei Xie and Lei Ma and Yan Zheng and Yan Song and Yingfeng Chen and Jianjun Zhao},
  journal= {arXiv preprint arXiv:2301.11490},
  year   = {2023}
}