OFVL-MS:一次实现跨多室内场景的视觉定位
计算机视觉与模式识别
2023-08-24 v1
摘要
在这项工作中,我们寻求以多任务学习的方式跨场景预测相机位姿,其中我们将每个场景的定位视为一个新任务。我们提出 OFVL-MS,一个统一框架,它摒弃了为每个单独场景训练模型的传统做法,并缓解了集体优化多个场景所引起的梯度冲突,从而以高效的存储实现对所有场景的精确视觉定位。在技术层面,在 OFVL-MS 的前向传播中,我们设计了一种层自适应共享策略,为每一层配备可学习分数以自动确定该层是否共享。这种共享策略使我们能够获得任务共享参数以减少存储成本,以及任务特定参数以学习场景相关特征从而缓解梯度冲突。在 OFVL-MS 的反向传播中,我们引入了一种梯度归一化算法,使任务共享参数的梯度幅值同质化,从而所有任务以相同步调收敛。此外,在可学习分数上施加稀疏惩罚损失,以在所有任务间促进参数共享而不降低性能。我们在多个基准和我们新发布的室内数据集 LIVL 上进行了综合实验,表明 OFVL-MS 系列以更少的参数显著优于当前最优方法。我们还验证了 OFVL-MS 能用极少参数泛化到新场景,同时获得优越的定位性能。
引用
@article{arxiv.2308.11928,
title = {OFVL-MS: Once for Visual Localization across Multiple Indoor Scenes},
author = {Tao Xie and Kun Dai and Siyi Lu and Ke Wang and Zhiqiang Jiang and Jinghan Gao and Dedong Liu and Jie Xu and Lijun Zhao and Ruifeng Li},
journal= {arXiv preprint arXiv:2308.11928},
year = {2023}
}