中文

NOLO:仅看一次即可导航

计算机视觉与模式识别 2024-11-19 v2

摘要

Transformer模型的内上下文学习能力为视觉导航带来了新的可能性。在本文中,我们聚焦于视频导航设定,其中内上下文导航策略需要纯粹从视频中离线学习,而无需访问实际环境。针对该设定,我们提出了仅看一次即可导航(NOLO)方法,用于学习具有内上下文能力的导航策略,通过接收相应的上下文视频作为输入来适应新场景,而无需微调或重新训练。为了实现从视频中学习,我们首先提出了一种利用光流从自我中心视频中恢复动作标签的伪动作标注过程。然后应用离线强化学习来学习导航策略。通过在模拟和真实环境中的不同场景上进行大量实验,我们展示了算法相比基线方法具有大幅度的优势,证明了所学习策略的内上下文学习能力。有关视频和更多信息,请访问https://sites.google.com/view/nol0。

关键词

引用

@article{arxiv.2408.01384,
  title  = {NOLO: Navigate Only Look Once},
  author = {Bohan Zhou and Zhongbin Zhang and Jiangxing Wang and Zongqing Lu},
  journal= {arXiv preprint arXiv:2408.01384},
  year   = {2024}
}