基于级联网络的熵正则化强化学习
机器学习
2022-10-18 v1
摘要
深度强化学习(Deep RL)在高维问题上取得了令人瞩目的成就,但其学习过程即便在最简单的任务上也仍不稳定。深度RL使用神经网络作为函数逼近器。这些神经模型在很大程度上受(无)监督机器学习社区发展的启发。与这些学习框架相比,RL的主要困难之一是缺乏独立同分布(i.i.d.)数据。应对该困难的一种方式是控制每次迭代中策略的变化率。在本工作中,我们挑战(无)监督学习社区使用固定神经架构的常规做法,采用一种在每次策略更新时规模增长的神经模型。这使得熵正则化策略更新具有闭式解,从而更好地控制每次迭代中策略的变化率,并有助于应对RL的非i.i.d.特性。在经典RL基准上的初步实验显示出有前景的结果,与其他深度RL基线相比在某些RL任务上具有显著的收敛性,同时在其他任务上表现出局限性。
引用
@article{arxiv.2210.08503,
title = {Entropy Regularized Reinforcement Learning with Cascading Networks},
author = {Riccardo Della Vecchia and Alena Shilova and Philippe Preux and Riad Akrour},
journal= {arXiv preprint arXiv:2210.08503},
year = {2022}
}