中文

面向多能源管理系统安全强化学习的带硬约束自适应安全层

系统与控制 2023-11-07 v3 人工智能 机器学习 系统与控制 最优化与控制

摘要

带硬约束保证的安全强化学习(RL)是多能源管理系统中一个有前景的最优控制方向。它仅需要事先知道环境特定的约束函数本身,而不需要完整模型。因此,项目特定的前期与持续工程工作量得以减少,底层系统动力学仍可被更好地学习,且建模偏差被保持在最小。然而,即便仅约束函数本身也并不总是易于提前准确给出,从而导致潜在的不安全行为。本文中,我们提出两项新颖进展:(I)将 OptLayer 与 SafeFallback 方法结合,称为 OptLayerPolicy,以在保持高采样效率及可表述等式约束能力的同时提升初始效用。(II)引入自我改进硬约束,以随着更多新数据可用而提高约束函数的准确性,从而可学习更好的策略。两项进展均使约束表述与 RL 表述解耦,因此新的( presumably 更好的)RL 算法可作为直接替换项。我们已在一个仿真的多能源系统案例研究中表明,初始效用提升至 92.4%(OptLayerPolicy)对比 86.1%(OptLayer),且训练后策略提升至 104.9%(GreyOptLayerPolicy)对比 103.4%(OptLayer)——均相对于 vanilla RL 基准。尽管在优化问题中引入代理函数需特别留意,我们得出结论:新提出的 GreyOptLayerPolicy 方法最具优势。

关键词

引用

@article{arxiv.2304.08897,
  title  = {An adaptive safety layer with hard constraints for safe reinforcement learning in multi-energy management systems},
  author = {Glenn Ceusters and Muhammad Andy Putratama and Rüdiger Franke and Ann Nowé and Maarten Messagie},
  journal= {arXiv preprint arXiv:2304.08897},
  year   = {2023}
}

备注

post-print