中文

线性二次型控制器中安全在线强化学习的基础:$\sqrt{T}$-Regret

机器学习 2025-04-29 v1 机器学习 系统与控制 系统与控制

摘要

了解如何在实际应用中遵循安全约束地有效学习对于使用在线强化学习至关重要。然而,由于安全、探索和开发之间的复杂相互作用,为安全约束的强化学习证明严格的 regret 界限具有困难。本文通过研究控制一个具有未知动力学的一维线性动力系统的问题,寻求建立安全约束强化学习的基础。我们研究了该问题的安全约束版本,其中状态必须以高概率保持在安全区域内,我们提供了首个实现 O~T(T)\tilde{O}_T(\sqrt{T}) regret 的安全算法。此外,该 regret 相对于截断线性控制器的基线,这是一种适合于安全约束线性系统的非线性控制器的自然基线。除了引入这一新基线外,我们还证明了该基线中最优控制器的几个令人满意的连续性质量。通过证明我们的主要结果,我们表明当约束影响最优控制器时,我们的控制器类别的非线性导致比受控环境中学习速度更快。

关键词

引用

@article{arxiv.2504.18657,
  title  = {Foundations of Safe Online Reinforcement Learning in the Linear Quadratic Regulator: $\sqrt{T}$-Regret},
  author = {Benjamin Schiffer and Lucas Janson},
  journal= {arXiv preprint arXiv:2504.18657},
  year   = {2025}
}