中文

基于线性矩阵不等式的数据高效二次Q学习

系统与控制 2025-04-09 v1 系统与控制

摘要

强化学习(RL)取得了显著的研究和应用成果,但往往需要大量训练数据。本文提出两种数据高效的离策略Q学习方法,采用参数化Q学习。在这些方法中,Q函数被设为参数线性、状态和控制偏离基策略中选取的基函数二次。对Bellman误差1\ell_1-范数的惩罚项被最小化。我们提出两种方法:线性矩阵不等式Q学习(LMI-QL)及其迭代变种(LMI-QLi),通过凸优化求解所得的episodic优化问题。LMI-QL依赖于一种凸松弛,产生一个半正定规划(SDP)问题,包含线性矩阵不等式(LMI)。LMI-QLi涉及求解一系列SDP问题的迭代求解。两种方法将凸优化与直接Q函数学习相结合,显著提高学习速度。数值案例研究表明,这些方法在数据效率方面优于现有的 参数化Q学习方法。

关键词

引用

@article{arxiv.2409.11986,
  title  = {Data-Efficient Quadratic Q-Learning Using LMIs},
  author = {J. S. van Hulst and W. P. M. H. Heemels and D. J. Antunes},
  journal= {arXiv preprint arXiv:2409.11986},
  year   = {2025}
}

备注

Accepted for Presentation at 63rd IEEE Conference on Decision and Control, CDC 2024, Milan, Italy, 2024