基于注意力与对比学习的联合深度与运动场估计
计算机视觉与模式识别
2021-10-14 v1 机器学习
机器人学
摘要
从单目视觉系统估计相机运动与场景三维结构是一项复杂任务,通常依赖于所谓的场景刚性假设。当观测动态环境时,该假设被违背,从而导致相机自运动与物体运动之间的歧义。为解决此问题,我们提出一种用于从单目视频估计三维物体运动场的自监督学习框架。我们的贡献有两点。首先,我们提出一个两阶段投影流水线,通过称为 DAM 的动力学注意力模块显式解耦相机自运动与物体运动。具体而言,我们设计了一个集成运动模型,分别在第一和第二扭曲阶段估计相机与物体的运动,由注意力模块通过共享运动编码器控制。其次,我们提出一种通过对比样本一致性(称为 CSAC)的物体运动场估计方法,利用弱语义先验(来自物体检测器的边界框)与几何约束(每个物体遵循刚体运动模型)。在 KITTI、Cityscapes 和 Waymo Open Dataset 上的实验证明了我们方法的相关性,并表明我们的方法在自监督单目深度估计、物体运动分割、单目场景流估计和视觉里程计任务上优于最先进算法。
引用
@article{arxiv.2110.06853,
title = {Attentive and Contrastive Learning for Joint Depth and Motion Field Estimation},
author = {Seokju Lee and Francois Rameau and Fei Pan and In So Kweon},
journal= {arXiv preprint arXiv:2110.06853},
year = {2021}
}
备注
ICCV 2021