中文

线性二次型调节器中安全在线强化学习的基础:广义基线

机器学习 2025-04-30 v2 机器学习 系统与控制 系统与控制

摘要

在线强化学习的许多实际应用要求在了解未知环境的同时满足安全约束。本文通过研究具有未知动力学但附加约束的线性二次型调节器这一典型问题,为带安全约束的强化学习建立了理论基础,该约束要求位置在整个轨迹中以高概率保持在安全区域内。我们的主要贡献是一个通用框架,用于研究更适合约束问题的非线性控制器这一更强的基线。由于在约束问题中分析非线性控制器的困难,我们专注于一维状态和动作空间,但也讨论了如何期望高层结论推广到更高维度。利用我们的框架,我们证明对于满足自然假设的任意非线性基线,当噪声分布具有足够大的支撑集时,可以实现 O~T(T)\tilde{O}_T(\sqrt{T}) 的遗憾,而对于任意次高斯噪声分布,可以实现 O~T(T2/3)\tilde{O}_T(T^{2/3}) 的遗憾。在证明这些结果时,我们为非线性控制引入了一种新的不确定性估计界,该界表明,在存在足够噪声的情况下强制安全性可以提供“自由探索”,从而补偿安全约束控制中不确定性的额外成本。

关键词

引用

@article{arxiv.2410.21081,
  title  = {Foundations of Safe Online Reinforcement Learning in the Linear Quadratic Regulator: Generalized Baselines},
  author = {Benjamin Schiffer and Lucas Janson},
  journal= {arXiv preprint arXiv:2410.21081},
  year   = {2025}
}