基于能量基准正规化流的最大熵强化学习
机器学习
2024-10-29 v2
摘要
现有的连续动作空间最大熵 (MaxEnt) 强化学习 (RL) 方法通常基于演员-评论家框架,通过交替进行策略评估和策略改进步骤来优化。在策略评估步骤中,通过更新软Q函数来更新评论家。在策略改进步骤中,根据更新后的软Q函数调整演员。在本文中,我们引入了基于能量基准正规化流 (EBFlow) 的新型MaxEnt RL框架。该框架将策略评估步骤和策略改进步骤集成为单个目标训练过程。我们的方法使能够在不采用蒙特卡罗近似的情况下计算用于策略评估目标的软价值函数。此设计支持多模态动作分布的建模,同时便于高效动作抽样。为评估方法性能,我们在MuJoCo基准套件和一系列由Omniverse Isaac Gym模拟的高维机器人任务上进行了实验。评估结果表明,我们的方法在与广泛采用的代表性基线方法相比具有卓越的性能。
引用
@article{arxiv.2405.13629,
title = {Maximum Entropy Reinforcement Learning via Energy-Based Normalizing Flow},
author = {Chen-Hao Chao and Chien Feng and Wei-Fang Sun and Cheng-Kuang Lee and Simon See and Chun-Yi Lee},
journal= {arXiv preprint arXiv:2405.13629},
year = {2024}
}
备注
Published at NeurIPS 2024. Code: https://github.com/ChienFeng-hub/meow