中文

面向物体导航任务的路标策略优化

人工智能 2021-09-21 v1 机器人学

摘要

本研究探讨物体目标导航任务,即在未知环境中导航至与给定语义类别相关的最近物体。近期工作在端到端强化学习方法与模块化系统方面均取得了显著成就,但仍需重大进展以实现鲁棒与最优。我们提出一种层次化方法,将标准任务表述与作为路标的额外区域知识相结合,并给出提取这些路标的方式。在层次结构中,低层由针对最直观技能分别训练的算法组成,高层决定当前时刻所需技能。借助所有提出的方案,我们在逼真的 Habitat 模拟器中取得了 0.75 的成功率。在模拟器中的重建虚拟区域进行一小阶段额外模型训练后,我们在真实世界案例中成功验证了结果。

关键词

引用

@article{arxiv.2109.09512,
  title  = {Landmark Policy Optimization for Object Navigation Task},
  author = {Aleksey Staroverov and Aleksandr I. Panov},
  journal= {arXiv preprint arXiv:2109.09512},
  year   = {2021}
}