RayTran:基于光线追踪Transformer的视频多目标三维姿态估计与形状重建
计算机视觉与模式识别
2022-08-29 v2
摘要
我们提出了一种基于Transformer的神经网络架构,用于从RGB视频中进行多目标三维重建。它依赖两种替代方式来表征其知识:作为全局三维特征网格和一组视角特定的二维网格。我们通过专用的双向注意力机制在两者间逐步交换信息。我们利用关于图像形成过程的知识显著稀疏化注意力权重矩阵,使我们的架构在当前硬件上在内存和计算方面均可行。我们在三维特征网格之上接入一个DETR风格的头,以检测场景中的目标并预测其三维姿态与三维形状。与先前方法相比,我们的架构是单阶段、端到端可训练的,并且能够从多个视频帧对整个场景进行整体推理,而无需脆弱的跟踪步骤。我们在具有挑战性的Scan2CAD数据集上评估了我们的方法,其性能优于(1)近期从RGB视频进行三维目标姿态估计的SOTA方法;以及(2)一种结合多视立体(Multi-view Stereo)与RGB-D CAD对齐的强替代方法。我们计划发布源代码。
引用
@article{arxiv.2203.13296,
title = {RayTran: 3D pose estimation and shape reconstruction of multiple objects from videos with ray-traced transformers},
author = {Michał J. Tyszkiewicz and Kevis-Kokitsi Maninis and Stefan Popov and Vittorio Ferrari},
journal= {arXiv preprint arXiv:2203.13296},
year = {2022}
}
备注
ECCV 2022 camera ready