中文

基于抑制网络的软演员-评论家方法用于加速再训练

机器学习 2022-02-09 v2 人工智能 神经与进化计算

摘要

在深度强化学习中,复用先前训练的模型对于加速新智能体的训练至关重要。然而,当目标与约束与已学技能相冲突时,如何获取新技能尚不清楚。此外,在再训练时,利用已学知识与探索新技能之间存在内在冲突。在软演员-评论家(SAC)方法中,温度参数可动态调整以权衡动作熵并平衡探索×利用的折衷。然而,在再训练背景下控制单一系数具有挑战性,当目标相互矛盾时更甚。受神经科学研究的启发,本文提出一种使用抑制网络的新方法,以实现分离且自适应的状态价值评估,以及独立的自动熵调节。最终,我们的方法可通过控制抑制来处理利用风险较低已获行为与探索新行为以克服更具挑战性任务之间的冲突。我们在 OpenAI Gym 环境中通过实验验证了该方法。

关键词

引用

@article{arxiv.2202.02918,
  title  = {Soft Actor-Critic with Inhibitory Networks for Faster Retraining},
  author = {Jaime S. Ide and Daria Mićović and Michael J. Guarino and Kevin Alcedo and David Rosenbluth and Adrian P. Pope},
  journal= {arXiv preprint arXiv:2202.02918},
  year   = {2022}
}

备注

16 pages including Appendix