中文

两步动态障碍物规避

机器人学 2024-08-20 v2 人工智能

摘要

动态障碍物规避(DOA)是任何自动驾驶载具的基本挑战,无论其在海上、空中还是陆地运行。本文提出一种结合监督学习与强化学习(RL)的两步架构来处理DOA任务。第一步,我们引入数据驱动方法,利用循环神经网络以监督方式训练来估计障碍物的碰撞风险(CR),该方法对非线性的障碍物运动具有鲁棒性。第二步,我们将这些CR估计纳入RL智能体的观测空间以提升其态势感知。我们在需于多个障碍物间导航的复杂环境中训练不同RL智能体,由此展示了两步架构的威力。障碍物的非线性运动以随机过程与周期模式为例建模,尽管本架构适用于任意障碍物动力学。实验表明,将CR指标纳入观测空间使奖励方面的性能翻倍,相当于在所考虑环境中碰撞次数减半。我们还进行了泛化实验,基于海上交通与真实船舶轨迹数据的RL环境中验证该方案。此外,我们表明架构的性能提升独立于所采用的RL算法。

关键词

引用

@article{arxiv.2311.16841,
  title  = {Two-step dynamic obstacle avoidance},
  author = {Fabian Hart and Martin Waltz and Ostap Okhrin},
  journal= {arXiv preprint arXiv:2311.16841},
  year   = {2024}
}