STDepthFormer:基于自监督Transformer模型从视频预测时空深度
计算机视觉与模式识别
2023-03-03 v1
摘要
本文提出了一种自监督模型,利用一种新颖的时空注意力(ST)网络同时从视频输入预测未来帧序列。该ST transformer网络能够在未来帧之间约束时间一致性,同时在图像中不同尺度上约束空间物体间的一致性。以往的深度预测工作并非如此,其侧重于将单帧作为输出进行预测。所提模型利用了先前的场景知识(如物体形状和纹理),类似于单图像深度推断方法,同时也约束了来自输入图像序列的运动与几何关系。除transformer架构外,相对于先前工作的主要贡献之一在于目标函数,其强制跨输出帧序列而非单输出帧的时空一致性。如将所示,这带来了更准确且鲁棒的深度序列预测。该模型在KITTI基准上取得了高度准确的深度预测结果,优于现有基线。我们进行了广泛的消融实验以评估所提技术的有效性。所提模型一个引人注目的结果是,它能够隐式地预测场景中物体的运动,而无需涉及多物体检测、分割与跟踪的复杂模型。
引用
@article{arxiv.2303.01196,
title = {STDepthFormer: Predicting Spatio-temporal Depth from Video with a Self-supervised Transformer Model},
author = {Houssem Boulahbal and Adrian Voicila and Andrew Comport},
journal= {arXiv preprint arXiv:2303.01196},
year = {2023}
}
备注
Submitted to IROS 2023