VDNA-PR:利用通用数据集表示实现鲁棒的序列视觉位置识别
计算机视觉与模式识别
2024-03-15 v1 机器人学
摘要
本文适配了一种通用数据集表示技术,以生成鲁棒的视觉位置识别(VPR)描述符,这对于实现真实世界移动机器人定位至关重要。关于VPR的两条并行研究路线表明:一方面,通用的现成特征表示能够对域偏移提供鲁棒性;另一方面,来自图像序列的融合信息可以提升性能。在我们近期关于测量图像数据集之间域差距的工作中,我们提出了一种神经元激活视觉分布(VDNA)表示来表示图像数据集。这种表示能够自然地处理图像序列,并提供源自通用模型的通用且细粒度的特征表示。此外,我们的表示基于在待表示的图像列表上跟踪神经元激活值,且不局限于特定的神经网络层,因此能够获取高层和低层概念。这项工作展示了如何通过学习一个非常轻量且简单的编码器来生成任务特定的描述符,从而将VDNA用于VPR。我们的实验表明,与现有解决方案相比,在面临远离训练数据分布的严重域偏移(例如室内环境和航空影像)时,我们的表示能够提供更好的鲁棒性。
引用
@article{arxiv.2403.09025,
title = {VDNA-PR: Using General Dataset Representations for Robust Sequential Visual Place Recognition},
author = {Benjamin Ramtoula and Daniele De Martini and Matthew Gadd and Paul Newman},
journal= {arXiv preprint arXiv:2403.09025},
year = {2024}
}
备注
Published at ICRA 2024