面向自动驾驶决策的计数器事实策略评估
机器学习
2020-11-13 v3 人工智能
机器人学
机器学习
摘要
基于学习的方法,如强化学习和模仿学习,在自动驾驶决策中正日益流行。然而,学习到的策略往往无法泛化,且不能很好地处理新颖情况。以“若其他智能体表现不同,某策略是否会表现良好?”的形式提问与作答,可揭示该策略在训练期间是否见过类似情况以及是否泛化良好。在本文工作中,引入了一种计数器事实策略评估,其利用计数器事实世界——其中他者行为为非实际的世界。若某策略能处理好所有计数器事实世界,则它要么在训练期间见过类似情况,要么泛化良好,并被认为足够适合在实际世界中执行。此外,通过执行计数器事实策略评估,改变车辆行为对周围车辆的因果关联与影响变得明显。为验证所提方法,我们使用强化学习为车道汇入场景学习了一个策略。在应用阶段,仅在进行计数器事实策略评估且发现策略足够安全后才执行该策略。我们表明所提方法在保持高成功率的同时显著降低了碰撞率。
引用
@article{arxiv.2003.11919,
title = {Counterfactual Policy Evaluation for Decision-Making in Autonomous Driving},
author = {Patrick Hart and Alois Knoll},
journal= {arXiv preprint arXiv:2003.11919},
year = {2020}
}
备注
Accepted at IROS 2020 PLC Workshop