中文

改进社交机器人导航中强化学习训练机制泛化能力的方法

机器人学 2024-03-01 v2 机器学习 多智能体系统

摘要

为使自主移动机器人在人类空间中导航,它们必须遵守我们的社会规范。强化学习(RL)已成为训练能够尊重这些规范的序贯决策策略的有效方法。然而,该领域大量现有工作都在简化环境中进行 RL 训练与测试。这限制了这些模型对未知环境的泛化潜力,也削弱了其所报告结果的意义。我们提出一种利用课程学习提升 RL 社交导航方法泛化性能的方法。通过使用多种环境类型及多种动力学模型建模行人,我们能够在训练中逐步多样化并提升难度。我们的结果表明,在训练中使用课程学习可比以往训练方法取得更好的泛化性能。我们还表明,许多现有最先进 RL 社交导航工作的结果并未在其训练环境之外评估其方法,因此未能反映其策略在分布外场景中泛化不足的问题。为此,我们在比训练所用更大、更拥挤的测试环境中验证我们的训练方法,从而实现对模型性能更有意义的度量。

关键词

引用

@article{arxiv.2308.14947,
  title  = {Improving Generalization in Reinforcement Learning Training Regimes for Social Robot Navigation},
  author = {Adam Sigal and Hsiu-Chin Lin and AJung Moon},
  journal= {arXiv preprint arXiv:2308.14947},
  year   = {2024}
}

备注

NeurIPS 2023 Workshop on Generalization in Planning, 2023