中文

基于分层应急规划的随机部分可观测环境中更安全的自动驾驶

机器学习 2022-04-14 v1 人工智能 机器人学

摘要

当学习在随机、部分可观测环境中行动时,智能体应准备好预期其对环境状态的信念发生变化,并能够随时根据变化的条件调整其动作。作为人类,我们能够在学习任务时形成应急计划,其明确目的是能够纠正初始控制中的错误,从而在我们对环境的感知突然变化并需要立即纠正行动时发挥作用。对于在真实世界中导航的自动驾驶车辆(AV)而言尤其如此,其中安全至关重要,且真正需要对环境信念变化做出强烈反应的能力。在本文中,我们探索了一种从训练到执行的端到端方法,用于学习鲁棒应急计划并将其与分层规划器结合,以在其它车辆行为未知、且智能体对这些行为的信念会发生突发最后一秒变化的自主导航任务中获得鲁棒智能体策略。我们表明,我们的方法在部分可观测随机环境中产生了鲁棒、安全的行为,并对训练期间未见的环境动态具有良好的泛化能力。

关键词

引用

@article{arxiv.2204.06509,
  title  = {Safer Autonomous Driving in a Stochastic, Partially-Observable Environment by Hierarchical Contingency Planning},
  author = {Ugo Lecerf and Christelle Yemdji-Tchassi and Pietro Michiardi},
  journal= {arXiv preprint arXiv:2204.06509},
  year   = {2022}
}

备注

To appear in Generalizable Policy Learning in the Physical World workshop (ICLR 2022)