中文

基于调制赫布加 Q 网络架构的深度强化学习

机器学习 2021-10-15 v5 机器学习

摘要

本文提出一种将调制赫布网络(MOHN)与 DQN 结合的新神经架构,我们称之为调制赫布加 Q 网络架构(MOHQA)。其假设是,此类组合使 MOHQA 能够解决损害基于时序差分(TD)的 RL 算法(如 DQN)的困难部分可观测马尔可夫决策过程(POMDP)问题,因为 TD 误差无法轻易从观测中导出。关键思想是使用带有生物启发神经迹的赫布网络,以在混淆观测与稀疏奖励导致不准确 TD 误差时,桥接动作与奖励间的时间延迟。在 MOHQA 中,DQN 学习低级特征与控制,而 MOHN 通过将奖励与过去状态及动作关联来贡献于高级决策。因此,所提架构结合了具有显著不同学习算法的两个模块:一个赫布联想网络与一个经典 DQN 流水线,利用了两者的优势。在一组 POMDP 及 MALMO 环境上的仿真表明,所提算法改进了 DQN 的结果,甚至在某些具混淆刺激与稀疏奖励的 POMDP 上优于采用 A2C、QRDQN+LSTM 与 REINFORCE 算法的对照测试。

关键词

引用

@article{arxiv.1909.09902,
  title  = {Deep Reinforcement Learning with Modulated Hebbian plus Q Network Architecture},
  author = {Pawel Ladosz and Eseoghene Ben-Iwhiwhu and Jeffery Dick and Yang Hu and Nicholas Ketz and Soheil Kolouri and Jeffrey L. Krichmar and Praveen Pilly and Andrea Soltoggio},
  journal= {arXiv preprint arXiv:1909.09902},
  year   = {2021}
}