OVRL-V2:一种用于 ImageNav 与 ObjectNav 的简洁最先进基线
计算机视觉与模式识别
2023-03-15 v1 人工智能
摘要
我们提出了一种由任务无关组件(ViTs、卷积和 LSTMs)构成的单一神经网络架构,在 ImageNav(“前往<此图片中>的位置”)和 ObjectNav(“找一个椅子”)任务上均取得了最先进结果,且无需任何如目标检测、分割、建图或规划等任务特定模块。此类通用方法具有设计简洁、随可用算力正向扩展以及可灵活适用于多任务的优势。我们的工作建立在自监督学习(SSL)预训练视觉Transformer(ViT)近期成功的基础之上。然而,尽管卷积网络的训练方案已成熟且鲁棒,ViT 的训练方案却不稳定且脆弱,且在视觉导航的 ViT 方面尚待充分探索。具体而言,我们发现原始 ViT 在视觉导航上并未优于 ResNet。我们提出在 ViT 块表示上使用压缩层以保留空间信息,并改进策略训练。这些改进使我们首次在视觉导航任务中展示了正向缩放定律。因此,我们的模型将 ImageNav 的最先进成功率从 54.2% 提升至 82.0%,并以 64.0% 对 65.0% 的成功率在 ObjectNav 上与同期最先进方法具竞争力。总体而言,本文并未提出一种根本性的新方法,而是给出了训练一种当今可达最先进性能的通用架构的建议,其可作为未来方法的强基线。
引用
@article{arxiv.2303.07798,
title = {OVRL-V2: A simple state-of-art baseline for ImageNav and ObjectNav},
author = {Karmesh Yadav and Arjun Majumdar and Ram Ramrakhya and Naoki Yokoyama and Alexei Baevski and Zsolt Kira and Oleksandr Maksymets and Dhruv Batra},
journal= {arXiv preprint arXiv:2303.07798},
year = {2023}
}
备注
15 pages, 7 figures, 9 tables