中文

基于多视图 SAM 的联合深度预测与语义分割

计算机视觉与模式识别 2023-11-02 v1

摘要

针对单目图像的联合深度与分割预测多任务方法已被充分研究。然而,单视图的预测 inherently 受限,而在许多机器人应用中多视图是可用的。在另一极端,基于视频和全 3D 的方法需要大量帧来进行重建与分割。本工作提出一种用于深度预测的多视图立体(MVS)技术,其受益于 Segment Anything Model (SAM) 的丰富语义特征。该增强的深度预测反过来作为我们基于 Transformer 的语义分割解码器的提示。我们在 ScanNet 数据集上的定量与定性研究中报告了两个任务所享有的互利。我们的方法持续优于单任务 MVS 与分割模型,以及多任务单目方法。

关键词

引用

@article{arxiv.2311.00134,
  title  = {Joint Depth Prediction and Semantic Segmentation with Multi-View SAM},
  author = {Mykhailo Shvets and Dongxu Zhao and Marc Niethammer and Roni Sengupta and Alexander C. Berg},
  journal= {arXiv preprint arXiv:2311.00134},
  year   = {2023}
}

备注

To appear in the 2024 IEEE/CVF Winter Conference on Applications of Computer Vision