逃离零梯度:通过 Frank-Wolfe 策略优化重访动作约束强化学习
机器学习
2021-08-03 v2
摘要
动作约束强化学习(RL)是多种真实应用场景中的广泛使用的方法,例如具有资源约束的网络化系统中的调度以及具有运动学约束的机器人控制。尽管现有的基于投影的方法能保证零约束违反,但由于策略梯度与投影的紧密耦合,它们可能遭受零梯度问题,从而导致采样低效的训练与缓慢的收敛。为应对该问题,我们提出了一种利用状态级 Frank-Wolfe 与基于回归的策略更新方案将动作约束与策略参数更新解耦的学习算法。此外,我们证明了所提算法在表格情形下具有收敛性与策略改进性质,并在一般情形下推广了面向动作约束 RL 的流行 DDPG 算法。通过实验,我们证明了所提算法在多种控制任务上显著优于基准方法。
引用
@article{arxiv.2102.11055,
title = {Escaping from Zero Gradient: Revisiting Action-Constrained Reinforcement Learning via Frank-Wolfe Policy Optimization},
author = {Jyun-Li Lin and Wei Hung and Shang-Hsuan Yang and Ping-Chun Hsieh and Xi Liu},
journal= {arXiv preprint arXiv:2102.11055},
year = {2021}
}
备注
Published in UAI 2021