面向单目深度预测的实例感知多目标自监督方法
计算机视觉与模式识别
2022-08-10 v2
摘要
本文提出一种自监督的单目图像到深度预测框架,该框架通过端到端的光度损失进行训练,不仅处理 6 自由度相机运动,还处理 6 自由度运动目标实例。自监督通过利用深度和包含目标实例的场景运动在视频序列间对图像进行变形来实现。所提方法的一个创新点是使用 Transformer 网络的多头注意力机制,跨时间匹配运动目标并建模其交互与动力学。这使得每个目标实例的位姿估计准确且鲁棒。大多数图像到深度预测框架假设场景为刚性,这极大地降低了它们在动态目标方面的性能。仅有少数 SOTA 论文考虑了动态目标。实验表明,所提方法在标准基准上优于这些方法,并揭示了动态运动对这些基准的影响。此外,所提出的图像到深度预测框架也显示出与 SOTA 视频到深度预测框架的竞争力。
引用
@article{arxiv.2203.00809,
title = {Instance-aware multi-object self-supervision for monocular depth prediction},
author = {Houssem Boulahbal and Adrian Voicila and Andrew Comport},
journal= {arXiv preprint arXiv:2203.00809},
year = {2022}
}
备注
IROS 2022 and RAL