中文

PIG-Nav: 预训练图像目标导航模型的关键见解

计算机视觉与模式识别 2025-07-24 v1 机器人学

摘要

近期研究探索了基于视觉的机器人导航的预训练(基础)模型,旨在实现跨不同环境的泛化导航和正向迁移,同时提升在未见环境中的零样本性能。本文提出PIG-Nav(预训练图像目标导航),一种进一步研究视觉导航模型预训练策略的新方法,并在两个关键领域做出贡献。在模型方面,我们确定了两个持续提升预训练导航模型性能的关键设计选择:(1)通过适当预训练的Vision Transformer(ViT)图像编码器,集成早期融合网络结构以结合视觉观测和目标图像;(2)引入合适的辅助任务以增强全局导航表示学习,从而进一步提升导航性能。在数据集方面,我们提出了一种新颖的数据预处理流程,用于高效标注大规模游戏视频数据集以训练导航模型。我们证明,用多样化的游戏视频增强现有开放导航数据集可提升模型性能。在两个复杂模拟环境和一个真实世界环境中,我们的模型在零样本设置下平均提升22.6%,在微调设置下平均提升37.5%,优于现有视觉导航基础模型。这些结果推进了预训练图像目标导航模型的最新技术水平。值得注意的是,我们的模型在保持竞争性能的同时,所需微调数据显著减少,突显了其在最少标注监督下进行真实世界部署的潜力。

关键词

引用

@article{arxiv.2507.17220,
  title  = {PIG-Nav: Key Insights for Pretrained Image Goal Navigation Models},
  author = {Jiansong Wan and Chengming Zhou and Jinkua Liu and Xiangge Huang and Xiaoyu Chen and Xiaohan Yi and Qisen Yang and Baiting Zhu and Xin-Qiang Cai and Lixing Liu and Rushuai Yang and Chuheng Zhang and Sherif Abdelfattah and Hayong Shin and Pushi Zhang and Li Zhao and Jiang Bian},
  journal= {arXiv preprint arXiv:2507.17220},
  year   = {2025}
}