GSNet:基于几何与场景感知监督的车辆位姿与形状联合重建
计算机视觉与模式识别
2020-07-28 v1
摘要
我们提出一种名为 GSNet(几何与场景感知网络)的新颖端到端框架,可从单张城市场景街景图像中联合估计 6DoF 位姿并重建精细 3D 车辆形状。GSNet 采用独特的四路特征提取与融合方案,在单次前向传播中直接回归 6DoF 位姿与形状。大量实验表明,我们多样的特征提取与融合方案能大幅提升模型性能。基于分而治之的 3D 形状表示策略,GSNet 重建出细节丰富的 3D 车辆形状(1352 个顶点与 2700 个面)。该稠密网格表示进一步促使我们考虑几何一致性与场景上下文,并启发了一种新的多目标损失函数以正则化网络训练,进而提升了 6D 位姿估计精度并验证了联合执行两项任务的优势。我们在最大的多任务 ApolloCar3D 基准上评估 GSNet,在定量与定性上均取得最先进性能。项目主页见 https://lkeab.github.io/gsnet/。
引用
@article{arxiv.2007.13124,
title = {GSNet: Joint Vehicle Pose and Shape Reconstruction with Geometrical and Scene-aware Supervision},
author = {Lei Ke and Shichao Li and Yanan Sun and Yu-Wing Tai and Chi-Keung Tang},
journal= {arXiv preprint arXiv:2007.13124},
year = {2020}
}
备注
ECCV 2020