中文

基于连续多模态推断的歧义场景 6D 相机重定位

计算机视觉与模式识别 2020-07-17 v2 机器学习 机器人学 图像与视频处理

摘要

我们提出一个多模态相机重定位框架,其通过定义在相机位姿流形上的连续混合模型来捕捉歧义与不确定性。在因场景对称与重复结构而易产生的高度歧义环境中,计算单一合理解(当前多数最先进方法所回归的)可能并不充分。我们转而预测多个相机位姿假设以及各预测相应的不确定性。为此,我们使用 Bingham 分布建模相机位姿的朝向,并用多元高斯建模位置,通过端到端深度神经网络实现。通过引入赢者通吃训练方案,我们最终获得一个适于解释场景歧义且不会遭受模式坍塌(混合密度网络的常见问题)的混合模型。我们引入一个专门设计用于推动歧义环境下相机定位研究的新数据集,并在合成与真实数据上针对歧义场景及非歧义基准数据集进行了详尽评估。我们计划于 \href\href{https://multimodal3dvision.github.io}{multimodal3dvision.github.io} 发布代码与数据集。

关键词

引用

@article{arxiv.2004.04807,
  title  = {6D Camera Relocalization in Ambiguous Scenes via Continuous Multimodal Inference},
  author = {Mai Bui and Tolga Birdal and Haowen Deng and Shadi Albarqouni and Leonidas Guibas and Slobodan Ilic and Nassir Navab},
  journal= {arXiv preprint arXiv:2004.04807},
  year   = {2020}
}

备注

Accepted for publication at ECCV 2020. Project page under https://multimodal3dvision.github.io