中文

用于深度强化学习社交感知导航的可变换高斯奖励函数

机器人学 2024-06-07 v2 人工智能

摘要

机器人导航已从优先考虑避障转变为采用适应人类存在的社交感知导航策略。因此,在以人为中心的动态环境中识别社交感知导航在机器人领域获得了重要关注。尽管强化学习技术促进了社交感知导航的发展,但定义合适的奖励函数,尤其是在拥挤环境中,仍是一项重大挑战。这些奖励在引导机器人动作中至关重要,但由于其复杂性和无法自动设置,需要复杂的人工设计。大量手动设计的奖励带来了超参数冗余、不平衡以及无法充分表征独特物体特征等问题。为了应对这些挑战,我们引入了一种可变换高斯奖励函数(TGRF)。TGRF 显著减轻了超参数调整的负担,展现出对各种奖励函数的适应性,并证明了加速的学习率,特别是在利用深度强化学习(DRL)的拥挤环境中表现优异。我们通过突出其概念背景、特征、实验和实际应用的部分介绍并验证了 TGRF,为机器人领域中更有效和更具适应性的方法铺平了道路。完整源代码可在 https://github.com/JinnnK/TGRF 获取。

关键词

引用

@article{arxiv.2402.14569,
  title  = {Transformable Gaussian Reward Function for Socially-Aware Navigation with Deep Reinforcement Learning},
  author = {Jinyeob Kim and Sumin Kang and Sungwoo Yang and Beomjoon Kim and Jargalbaatar Yura and Donghan Kim},
  journal= {arXiv preprint arXiv:2402.14569},
  year   = {2024}
}

备注

22 pages, 9 figures