中文

面向图像-目标导航的 Transformer 模型

机器人学 2024-05-27 v2 计算机视觉与模式识别 机器学习

摘要

视觉感知和导航已成为具身人工智能领域的主要关注方向。我们考虑图像-目标导航任务,即智能体需仅凭 onboard 摄像头的图像导航至由图像指定的目标。这一任务尤其具有挑战性,因为它需要可靠的场景理解、以目标为导向的规划和长程导航。大多数现有方法通常依赖于基于在线强化学习训练的循环神经网络。然而,这些策略的训练需要大量计算资源和时间,而且在长程导航上的性能并不可靠。本文提出了一种基于生成式 Transformer 的模型,联合建模图像目标、摄像头观察和机器人过去的动作,以预测未来动作。我们采用最先进的感知模型和导航策略,在无需与环境实时交互的情况下学习稳健的以目标为导向的策略。我们的模型在捕获和关联跨越长时间尺度的视觉信息方面具有能力,有助于有效导航。注意:本工作作为硕士论文 capstone 项目提交,需视为此类。此版本仍处于早期阶段,尚非最终版本。

关键词

引用

@article{arxiv.2405.14128,
  title  = {Transformers for Image-Goal Navigation},
  author = {Nikhilanj Pelluri},
  journal= {arXiv preprint arXiv:2405.14128},
  year   = {2024}
}

备注

NOTE: This work was submitted as part of a Master's Capstone Project and must be treated as such. This is still an early work in progress and not the final version