JIST:面向序列视觉位置识别的图像与序列联合训练
计算机视觉与模式识别
2024-04-01 v1
摘要
视觉位置识别旨在依靠视觉线索识别先前访问过的位置,并用于机器人应用中的 SLAM 和定位。由于移动机器人通常可以访问连续的帧流,因此该任务自然被构建为序列到序列的定位问题。然而,获取带标签的数据序列比收集孤立图像要昂贵得多,后者可以通过极少监督以自动化方式完成。作为对该问题的缓解,我们提出了一种新颖的图像与序列联合训练协议(JIST),通过多任务学习框架利用大量未整理的图像集。借助 JIST,我们还引入了 SeqGeM,这是一种聚合层,重新审视了流行的 GeM 池化,以从一系列单帧嵌入中生成单个鲁棒且紧凑的嵌入。我们表明,我们的模型能够超越先前的 SOTA,同时速度更快,使用的描述符小 8 倍,架构更轻量,并且允许处理各种长度的序列。代码可在 https://github.com/ga1i13o/JIST 获取。
引用
@article{arxiv.2403.19787,
title = {JIST: Joint Image and Sequence Training for Sequential Visual Place Recognition},
author = {Gabriele Berton and Gabriele Trivigno and Barbara Caputo and Carlo Masone},
journal= {arXiv preprint arXiv:2403.19787},
year = {2024}
}