基于位姿偏移矩阵表示通过视图合成学习相机位姿的神经表示
计算机视觉与模式识别
2021-05-11 v3
摘要
如何有效表示相机位姿是三维计算机视觉中的一个基本问题,尤其在相机位姿回归与新视角合成等任务中。传统上,相机的三维位置由笛卡尔坐标表示,朝向由欧拉角或四元数表示。这些表示是人工设计的,对于下游任务而言未必是最有效的表示。本工作中,我们提出一种学习相机位姿与三维场景神经表示的方法,并耦合以局部相机运动的神经表示。具体而言,相机位姿与三维场景表示为向量,局部相机运动表示为作用于相机位姿向量上的矩阵。我们证明该相机运动可进一步由神经空间中底层旋转系统的矩阵李代数参数化。随后将这些向量表示拼接,并通过解码网络生成带位姿的二维图像。该模型仅从带位姿的二维图像及相应相机位姿中学习,无需深度或形状信息。我们在合成与真实数据集上进行了大量实验。结果表明,与其他相机位姿表示相比,我们所学的表示在新视角合成中对噪声更具鲁棒性,且在相机位姿回归中更为有效。
引用
@article{arxiv.2104.01508,
title = {Learning Neural Representation of Camera Pose with Matrix Representation of Pose Shift via View Synthesis},
author = {Yaxuan Zhu and Ruiqi Gao and Siyuan Huang and Song-Chun Zhu and Ying Nian Wu},
journal= {arXiv preprint arXiv:2104.01508},
year = {2021}
}