中文

基于诱导与限制表示的等变单视图位姿预测

计算机视觉与模式识别 2023-07-10 v1 机器学习 群论

摘要

从二维图像了解三维世界是计算机视觉中的基本问题。此类任务的理想神经网络架构应利用物体可在三维中旋转和平移这一事实,对新颖图像进行预测。然而,在二维输入上施加 SO(3)-等变性是困难的,因为三维旋转群在二维平面上没有自然作用。具体而言,SO(3) 的元素可能将图像旋转出平面。我们表明,从二维图像学习三维世界表示的算法必须满足某些几何一致性性质,我们将其表述为 SO(2)-等变性约束。我们利用 SO(2) 在 SO(3) 上的诱导与限制表示来构造并分类满足这些几何一致性约束的架构。我们证明,任何遵从所述一致性约束的架构都可实现为我们构造的实例。我们指出三种先前提出的用于 3D 位姿预测的神经网络架构是我们构造的特例。我们提出一种新算法,它是先前方法的或可学习推广。我们在三个位姿预测任务上测试了我们的架构,并在 PASCAL3D+ 与 SYMSOL 位姿估计任务上取得了 SOTA 结果。

关键词

引用

@article{arxiv.2307.03704,
  title  = {Equivariant Single View Pose Prediction Via Induced and Restricted Representations},
  author = {Owen Howell and David Klee and Ondrej Biza and Linfeng Zhao and Robin Walters},
  journal= {arXiv preprint arXiv:2307.03704},
  year   = {2023}
}