面向连续时间不确定线性-二次型强化学习问题的数据驱动探索
机器学习
2025-07-24 v2 人工智能
系统与控制
系统与控制
最优化与控制
摘要
我们研究了针对连续时间随机线性-二次(LQ)控制问题的强化学习(RL),其中波动性依赖于状态和控制,状态为标量值,运行控制奖励为零。我们提出一种模型无关的数据驱动探索机制,通过 critic 和 policy 自适应调整熵正则化和 actor 的方差。与 [cite{huang2024sublinear}] 中常数或确定性探索计划不同,该计划在实现和迭代期间忽略学习进度,需要 extensive 调整。我们的自适应探索方法通过最小化调优提升学习效率。尽管具有灵活性,我们的方法实现了与该类 LQ 问题最佳已知模型无关结果相匹配的亚线性后悔界,这些结果仅适用于具有固定探索计划的模型无关情形。数值实验表明,自适应探索加快了收敛速度并改善了后悔性能,优于非自适应模型无关和模型基准方法。
引用
@article{arxiv.2507.00358,
title = {Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems},
author = {Yilie Huang and Xun Yu Zhou},
journal= {arXiv preprint arXiv:2507.00358},
year = {2025}
}
备注
37 pages, 10 figures