通过对应作为涌现现象实现端到端(实例-)图像目标导航
计算机视觉与模式识别
2023-09-29 v1
摘要
大多数近期面向目标的视觉导航工作求助于模拟环境中的大规模机器学习。主要挑战在于学习可泛化至未见环境的紧凑表示,以及学习能够对高维输入进行推理的高容量感知模块。当目标不是以类别给出("ObjectNav")而是以示例图像给出("ImageNav")时,后者尤为困难,因为感知模块需要学习一种比较策略,要求解决底层的视觉对应问题。已表明仅从奖励或借助标准辅助任务难以做到这一点。我们通过一系列两个前置任务来解决该问题,其作为我们所认为的感知主要瓶颈之一——复杂场景中极宽基线相对位姿估计与可见性预测的先验。第一个前置任务,跨视角补全,是底层视觉对应问题的代理,而第二个任务直接处理目标检测与寻找。我们提出了一种带有大容量双目ViT模型的新双编码器,并展示对应解从训练信号中自然涌现。实验显示在ImageNav及实例-图像导航变体两个基准上取得显著提升与SOTA性能,其中观测与目标间的相机内参与高度不同。
引用
@article{arxiv.2309.16634,
title = {End-to-End (Instance)-Image Goal Navigation through Correspondence as an Emergent Phenomenon},
author = {Guillaume Bono and Leonid Antsfeld and Boris Chidlovskii and Philippe Weinzaepfel and Christian Wolf},
journal= {arXiv preprint arXiv:2309.16634},
year = {2023}
}