中文

面向动态场景自监督深度-位姿学习的注意力分离与聚合网络

计算机视觉与模式识别 2020-11-19 v1 人工智能 机器人学

摘要

通过极线投影的自监督从未标注视频中学习深度与自运动,可提升基于视觉机器人的三维感知与定位的鲁棒性和精度。然而,由自运动计算的刚性投影无法表示所有场景点,例如运动物体上的点,从而在这些区域产生错误的监督信号。为解决该问题,我们提出注意力分离与聚合网络(ASANet),其可通过注意力机制学习区分并提取场景的静态与动态特征。我们进一步提出一种以ASANet为编码器、后接两个独立解码器的新型MotionNet,用于估计相机的自运动与场景的动态运动场。随后,我们引入一种自动选择方法,以自动检测运动物体用于动态感知学习。实证实验表明,我们的方法在KITTI基准上可达到最先进的性能。

关键词

引用

@article{arxiv.2011.09369,
  title  = {Attentional Separation-and-Aggregation Network for Self-supervised Depth-Pose Learning in Dynamic Scenes},
  author = {Feng Gao and Jincheng Yu and Hao Shen and Yu Wang and Huazhong Yang},
  journal= {arXiv preprint arXiv:2011.09369},
  year   = {2020}
}

备注

accepted by CoRL2020