基于少样本场景区域分类的视觉定位
计算机视觉与模式识别
2022-08-16 v1
摘要
视觉(重)定位解决的是估计在已知场景中捕获的查询图像的 6-DoF(自由度)相机位姿的问题,这是许多计算机视觉与机器人应用的关键组成部分。基于结构的定位近期进展通过用神经网络记忆从图像像素到场景坐标的映射来建立 2D-3D 对应关系以优化相机位姿,从而解决该问题。然而,这种记忆需要在每个场景中使用大量带位姿图像进行训练,繁重且低效。相反,少样本图像通常足以覆盖场景的主要区域,供人类操作员执行视觉定位。本文中,我们提出一种场景区域分类方法,以少样本图像实现快速有效的场景记忆。我们的思路是利用 a) 预训练特征提取器、b) 场景区域分类器以及 c) 元学习策略来加速训练并同时缓解过拟合。我们在室内与室外基准上评估了我们的方法。实验验证了我们的方法在少样本设定下的有效性,且训练时间显著缩短至仅几分钟。代码见:\url{https://github.com/siyandong/SRC}
引用
@article{arxiv.2208.06933,
title = {Visual Localization via Few-Shot Scene Region Classification},
author = {Siyan Dong and Shuzhe Wang and Yixin Zhuang and Juho Kannala and Marc Pollefeys and Baoquan Chen},
journal= {arXiv preprint arXiv:2208.06933},
year = {2022}
}
备注
3DV 2022