线性二次强化学习中的鲁棒探索
最优化与控制
2019-06-05 v1 机器学习
机器学习
摘要
本文关注为未知线性动力系统学习控制策略以最小化二次代价函数的问题。我们提出一种基于凸优化的方法,可鲁棒地完成该任务:即我们考虑给定观测数据下的系统不确定性,最小化最坏情况代价。该方法平衡利用与探索,以能降低最坏情况代价最敏感之模型参数不确定性的方式激励系统。数值仿真与在环硬件伺服机构的实际应用展示了该方法,在两者中都观察到相较替代方法可观的性能与鲁棒性提升。
引用
@article{arxiv.1906.01584,
title = {Robust exploration in linear quadratic reinforcement learning},
author = {Jack Umenberger and Mina Ferizbegovic and Thomas B. Schön and Håkan Hjalmarsson},
journal= {arXiv preprint arXiv:1906.01584},
year = {2019}
}