中文

基于即时安全约束的线性 MDP 下的可证明高效强化学习

机器学习 2025-02-27 v1

摘要

在强化学习(RL)中,具有即时硬约束的任务在决策空间为非凸或非星形凸的情况下 presents 重大挑战,这与自主车辆和机器人等领域的约束(如碰撞规避)常常采取非凸形式的事实有关。本文我们建立了一个为 O~((1+1τ)log(1τ)d3H4K)\tilde{\mathcal{O}}\bigl(\bigl(1 + \tfrac{1}{\tau}\bigr) \sqrt{\log(\tfrac{1}{\tau}) d^3 H^4 K} \bigr) 界限的 regret bound,适用于星形凸和非星形凸两种情况,其中 dd 为特征维数,HH 为剧集长度,KK 为剧集次数,τ\tau 为安全阈值。此外,安全约束的违反在整个学习过程中以高概率为零。这些设置下的关键技术挑战在于对价值函数类的覆盖数进行界定,这对于实现基于值的均匀浓度在无模型函数逼近中至关重要。对于星形凸情况,我们发展了一种称为目标约束分解(OCD)的新型技术,用于正确界定覆盖数。该结果也解决了之前关于受约束 RL 的一个错误。对于非星形凸场景,其中覆盖数可以变得无限大,我们提出了一个两阶段算法 Non-Convex Safe Least Squares Value Iteration (NCS-LSVI),该算法首先通过执行已知的安全策略来减少关于安全集合的不确定性。随后,它仔细地在探索与利用之间取得平衡,以实现该 regret bound。最后,针对自主驾驶情景的数值仿真表明 NCS-LSVI 的有效性。

关键词

引用

@article{arxiv.2502.18655,
  title  = {Provably Efficient RL for Linear MDPs under Instantaneous Safety Constraints in Non-Convex Feature Spaces},
  author = {Amirhossein Roknilamouki and Arnob Ghosh and Ming Shi and Fatemeh Nourzad and Eylem Ekici and Ness B. Shroff},
  journal= {arXiv preprint arXiv:2502.18655},
  year   = {2025}
}