中文

基于词典序深度强化学习的机会约束控制

机器学习 2020-10-20 v1 人工智能 系统与控制 系统与控制

摘要

本文提出一种基于词典序深度强化学习(DeepRL)的机会约束马尔可夫决策过程方法,其中控制器力求使满足约束的概率高于给定阈值。标准 DeepRL 方法要求 i) 以多目标方式将约束作为附加加权项纳入代价函数,以及 ii) 在深度神经网络(DNN)训练阶段根据概率阈值对引入的权重进行调参。相反,所提方法需要分别训练一个无约束 DNN 和每个约束对应的一个 DNN,然后在每个时间步根据系统观测状态选择使用哪个 DNN。即便概率阈值发生变化,所提方案除标准 DNN 超参数外无需任何超参数调参。本文还提出了著名 DeepRL 算法 DQN 的词典序版本,并通过仿真进行了验证。

关键词

引用

@article{arxiv.2010.09468,
  title  = {Chance-Constrained Control with Lexicographic Deep Reinforcement Learning},
  author = {Alessandro Giuseppi and Antonio Pietrabissa},
  journal= {arXiv preprint arXiv:2010.09468},
  year   = {2020}
}

备注

published version at: https://doi.org/10.1109/LCSYS.2020.2979635 in this version we fixed a typo in (9)