中文

用于推进基于强化学习的自动驾驶车辆控制的在线演化框架

系统与控制 2020-06-17 v2 人工智能 机器人学 系统与控制

摘要

本文提出一种在线演化框架,用于提前检测并修正控制器不完善的决策。该框架由三个模块组成:演化有限状态机(e-FSM)、动作修正器和控制器模块。e-FSM 模块通过反复确定新状态并识别转移概率,从零开始演化出一个随机模型(例如离散时间马尔可夫链)。利用最新的随机模型和给定准则,动作修正器模块通过预测未来状态来检验控制器所选动作的有效性。随后,若所选动作不合适,则检查并选取另一动作。为展示所提框架的优势,将带与不带该在线演化框架的深度确定性策略梯度(DDPG)应用于跟车场景中控制本车,其中控制准则由速度与安全设定。实验结果表明,DDPG 控制器选取的不当动作经所提框架被恰当检测与修正,从而在数次迭代后未出现控制失效。

关键词

引用

@article{arxiv.2006.08092,
  title  = {An online evolving framework for advancing reinforcement-learning based automated vehicle control},
  author = {Teawon Han and Subramanya Nageshrao and Dimitar P. Filev and Umit Ozguner},
  journal= {arXiv preprint arXiv:2006.08092},
  year   = {2020}
}

备注

Accepted in IFAC 2020 WC