VANP:通过自监督视觉-动作预训练学习导航中的注视区域
机器人学
2025-01-03 v3 计算机视觉与模式识别
摘要
人类擅长通过关注与导航相关的特定视觉区域,在人群中高效无碰撞地穿行。然而,大多数机器人视觉导航方法依赖在视觉任务上预训练的深度学习模型,这些模型优先关注显著目标——未必与导航相关且可能产生误导。替代方法则从头训练专用导航模型,需要大量计算。另一方面,自监督学习已革新了计算机视觉和自然语言处理,但由于难以定义有效的自监督信号,其在机器人导航中的应用仍探索不足。受这些观察启发,本文提出一种用于视觉导航预训练的自监督视觉-动作模型(VANP)。VANP 不检测对分类或检测等任务有益的显著目标,而是学习仅关注与导航任务相关的特定视觉区域。为实现这一点,VANP 利用视觉观测历史、未来动作和目标图像进行自监督,并使用两个小型 Transformer 编码器对其进行嵌入。然后,VANP 通过互信息最大化目标函数来最大化嵌入之间的信息。我们证明,大多数 VANP 提取的特征与人类导航直觉相符。VANP 以一半的训练时间达到了与端到端学习模型相当的性能,且仅使用大规模全监督数据集(即 ImageNet)0.08% 的数据,即可达到与之相当的模型性能。
引用
@article{arxiv.2403.08109,
title = {VANP: Learning Where to See for Navigation with Self-Supervised Vision-Action Pre-Training},
author = {Mohammad Nazeri and Junzhe Wang and Amirreza Payandeh and Xuesu Xiao},
journal= {arXiv preprint arXiv:2403.08109},
year = {2025}
}
备注
Extended version of the paper accepted at IROS 2024. Code: https://github.com/mhnazeri/VANP