面向动态场景自监督深度-位姿学习的注意力分离与聚合网络
计算机视觉与模式识别
2020-11-19 v1 人工智能
机器人学
摘要
通过极线投影的自监督从未标注视频中学习深度与自运动,可提升基于视觉机器人的三维感知与定位的鲁棒性和精度。然而,由自运动计算的刚性投影无法表示所有场景点,例如运动物体上的点,从而在这些区域产生错误的监督信号。为解决该问题,我们提出注意力分离与聚合网络(ASANet),其可通过注意力机制学习区分并提取场景的静态与动态特征。我们进一步提出一种以ASANet为编码器、后接两个独立解码器的新型MotionNet,用于估计相机的自运动与场景的动态运动场。随后,我们引入一种自动选择方法,以自动检测运动物体用于动态感知学习。实证实验表明,我们的方法在KITTI基准上可达到最先进的性能。
引用
@article{arxiv.2011.09369,
title = {Attentional Separation-and-Aggregation Network for Self-supervised Depth-Pose Learning in Dynamic Scenes},
author = {Feng Gao and Jincheng Yu and Hao Shen and Yu Wang and Huazhong Yang},
journal= {arXiv preprint arXiv:2011.09369},
year = {2020}
}
备注
accepted by CoRL2020