一种用于自由终端时间最优控制的 actor-critic 方法
最优化与控制
2022-08-08 v2
摘要
具有自由终端时间的最优控制问题带来诸多挑战,包括非光滑且不连续的控制律、不规则的值函数、大量局部最优解以及维数灾难。为克服这些问题,我们通过对指数变换的改进,将强化学习领域的基于模型的 actor-critic 范式进行适配,以学习近似反馈控制与值函数对。我们在具有此类问题各项主要病态特征的典型示例上展示了该算法的有效性。
引用
@article{arxiv.2208.00065,
title = {An Actor Critic Method for Free Terminal Time Optimal Control},
author = {Evan Burton and Tenavi Nakamura-Zimmerer and Qi Gong and Wei Kang},
journal= {arXiv preprint arXiv:2208.00065},
year = {2022}
}