通过直接监督实现更简单的近最优控制器
最优化与控制
2009-08-21 v1
摘要
广义Hamilton-Jacobi-Bellman方程(GHJB)方法是一种通过学习创建近最优控制器的强大方法。其基础在于:如果我们有一个反馈控制器,并学会计算其代价函数梯度grad-J,那么就可以利用该梯度定义一个更好的控制器。然后,我们可以使用新控制器的grad-J来定义更优的控制器,依此类推。本文指出,GHJB以间接方式工作,即它并非学习grad-J的最佳逼近,而是学习时间导数dJ/dt,并由此推断出grad-J。我们证明,通过直接学习grad-J,可以获得更简单且成本更低的控制器。为此,我们需要提供针对一组不同状态x的grad-J(x)的教学信号。本文展示了如何获取这些信号:利用GHJB方程计算grad-J(x)的一个分量——即与dx/dt平行的分量——并通过反向时间积分,使用类似于Euler-Lagrange方程的公式计算所有其他分量。随后,我们在两个测试问题上将该直接算法与GHJB进行了比较。
引用
@article{arxiv.0908.2859,
title = {Simpler near-optimal controllers through direct supervision},
author = {Douglas Tweed},
journal= {arXiv preprint arXiv:0908.2859},
year = {2009}
}