中文

用于交互式自动驾驶的迭代模仿策略改进

机器人学 2021-09-06 v1

摘要

我们提出一种用于城市交通中具有交互的自动驾驶的模仿学习系统。我们训练一个行为克隆(BC)策略来模仿从真实城市交通中收集的驾驶行为,并应用数据聚合算法迭代地改进其性能。在此设定中应用数据聚合面临两个挑战。第一个挑战是在真实城市交通中收集在线rollout数据代价高昂且危险。在如CARLA等仿真器中创建类似交通场景用于在线rollout收集也可能很困难。作为替代,我们提出从训练数据集创建一个弱仿真器,其中所有周围车辆均遵循数据集提供的数据轨迹。我们发现在此类仿真器中收集的在线数据仍可用于改进BC策略的性能。第二个挑战是在线rollout过程中繁琐且耗时的人工标注过程。为解决该问题,我们使用A^*规划器作为伪专家提供类专家演示。我们在真实城市交通场景中验证了所提出的模仿学习系统。实验结果表明我们的系统能显著改进基线BC策略的性能。

关键词

引用

@article{arxiv.2109.01288,
  title  = {Iterative Imitation Policy Improvement for Interactive Autonomous Driving},
  author = {Zhao-Heng Yin and Chenran Li and Liting Sun and Masayoshi Tomizuka and Wei Zhan},
  journal= {arXiv preprint arXiv:2109.01288},
  year   = {2021}
}