中文

基于学习行为模型的树结构策略规划

机器人学 2023-02-28 v2 系统与控制 系统与控制

摘要

自动驾驶车辆(AVs)在规划自身运动时需要推理邻近智能体的多模态行为。许多现有轨迹规划器寻求在\emph{所有}合理未来下同时表现良好的单一轨迹,忽略了双向交互,从而导致过于保守的规划。策略规划(ego 智能体规划对环境的多模态行为作出反应的策略)是一个有前景的方向,因为它可以考量 AV 与环境之间的动作-反应交互。然而,大多数现有策略规划器无法扩展到真实自动驾驶车辆应用的复杂度:它们要么与现代深度学习预测模型不兼容,要么不可解释,要么无法生成高质量轨迹。为填补这一空白,我们提出树策略规划(Tree Policy Planning, TPP),一种与最先进深度学习预测模型兼容、生成多阶段运动规划、并考量 ego 智能体对环境行为影响的策略规划器。TPP 的关键思想是通过构建两种树结构将连续优化问题化简为可处理的离散马尔可夫决策过程(Markov Decision Process, MDP):用于 ego 轨迹选项的自轨迹树,以及用于多模态 ego 条件环境预测的场景树。我们基于真实世界 nuScenes 数据集在闭环仿真中展示了 TPP 的有效性,结果表明 TPP 可扩展到真实 AV 场景,并显著优于非策略基线。

关键词

引用

@article{arxiv.2301.11902,
  title  = {Tree-structured Policy Planning with Learned Behavior Models},
  author = {Yuxiao Chen and Peter Karkus and Boris Ivanovic and Xinshuo Weng and Marco Pavone},
  journal= {arXiv preprint arXiv:2301.11902},
  year   = {2023}
}