中文

面向复杂连续状态-动作空间的专用深度残差策略安全强化学习控制器

机器学习 2023-10-24 v1 人工智能 系统与控制 系统与控制

摘要

传统控制器存在局限,因其依赖关于问题物理机制的先验知识、需要对动力学建模,且难以适应异常情况。深度强化学习有望通过在环境中探索来学习最优控制策略,从而解决这些问题。对于安全关键环境,随机探索不切实际,且以黑盒模型替代常规控制器也不可取。此外,在连续状态与动作空间中代价高昂,除非对搜索空间加以约束。为应对这些挑战,我们提出一种适用于复杂连续状态-动作空间的专用深度残差策略安全强化学习及学习周期方法。残差策略学习允许学习一种混合控制架构,其中强化学习智能体与常规控制器同步协作。学习周期通过专家轨迹初始化策略并引导其周边探索。进一步,通过输入-输出隐马尔可夫模型的专用化有助于优化位于感兴趣区域(如异常)内的策略,该处需要并激活强化学习智能体。所提方案在田纳西-伊斯曼过程控制上得到验证。

关键词

引用

@article{arxiv.2310.14788,
  title  = {Specialized Deep Residual Policy Safe Reinforcement Learning-Based Controller for Complex and Continuous State-Action Spaces},
  author = {Ammar N. Abbas and Georgios C. Chasparis and John D. Kelleher},
  journal= {arXiv preprint arXiv:2310.14788},
  year   = {2023}
}