中文

FlowPG:基于归一化流的动作约束策略梯度

机器学习 2024-02-09 v1 人工智能

摘要

动作约束强化学习(ACRL)是解决安全关键型和资源分配相关决策问题的常用方法。ACRL 的一个主要挑战是确保智能体在每一步强化学习中采取满足约束的有效动作。常用的在策略网络之上使用投影层的方法需要求解一个优化问题,这可能导致更长的训练时间、收敛缓慢以及零梯度问题。为了解决这个问题,首先,我们使用归一化流模型来学习可行动作空间与潜变量上简单分布(如高斯分布)的支撑集之间的可逆、可微映射。其次,学习流模型需要从可行动作空间中进行采样,这同样具有挑战性。我们开发了多种基于哈密顿蒙特卡洛和概率判决图的方法,用于凸约束和非凸约束下的动作采样。第三,我们将学习到的归一化流与 DDPG 算法集成。通过设计,一个训练良好的归一化流将策略输出转换为有效动作,而无需优化求解器。经验表明,我们的方法显著减少了约束违反(在多个实例中高达一个数量级),并且在各种连续控制任务上速度提高了数倍。

引用

@article{arxiv.2402.05149,
  title  = {FlowPG: Action-constrained Policy Gradient with Normalizing Flows},
  author = {Janaka Chathuranga Brahmanage and Jiajing Ling and Akshat Kumar},
  journal= {arXiv preprint arXiv:2402.05149},
  year   = {2024}
}