中文

陌生危险!识别并规避基于强化学习的社交机器人导航中的不可预测行人

机器人学 2024-08-14 v1 人工智能

摘要

基于强化学习(RL)的方法在通过大规模人群中导航方面取得了很大成功,但由于模型对代表性训练数据的依赖,这些基于学习的方法在特定困难或不熟悉的情况下性能会下降。为确保人类安全和舒适,关键在于这些算法能够恰当地处理不常见的情况,但不频繁且高度多样化的情况为数据驱动方法带来了重大挑战。为克服这一挑战,我们提出了修改学习过程的方案,以鼓励这些RL策略在不熟悉的情况下保持额外的警惕。具体而言,我们通过(1)修改训练过程以系统性地引入行人模型的偏差,(2)更新价值网络以估计并利用行人不可预测性特征,(3)实施奖励函数以学习有效的对抗行人不可预测性的响应。与原始SARL策略相比,我们的修改后策略在保持类似的导航时间和路径长度的同时,将碰撞次数减少82%,将在最困难情况下占据行人个人空间时间比例最多降低19个百分点。我们还描述了如何将这些修改应用于其他RL策略,并演示了这些方法的一些关键高层行为可转移到物理机器人上。

关键词

引用

@article{arxiv.2407.06056,
  title  = {Stranger Danger! Identifying and Avoiding Unpredictable Pedestrians in RL-based Social Robot Navigation},
  author = {Sara Pohland and Alvin Tan and Prabal Dutta and Claire Tomlin},
  journal= {arXiv preprint arXiv:2407.06056},
  year   = {2024}
}