中文

Cityscapes-3D上的联合2D-3D多任务学习:3D检测、分割与深度估计

计算机视觉与模式识别 2023-04-07 v3 机器学习

摘要

本报告作为TaskPrompter的补充文档,详述其在基于Cityscapes-3D的新联合2D-3D多任务学习基准上的实现。TaskPrompter提出了一种创新的多任务提示框架,统一了(i)任务通用表征、(ii)任务特定表征与(iii)跨任务交互的学习,而先前方法将这些学习目标分离至不同网络模块。这种统一方法不仅减少了对精细经验结构设计的需求,还显著增强了多任务网络的表征学习能力,因为整个模型容量都用于同时优化三个目标。TaskPrompter基于Cityscapes-3D数据集引入了新的多任务基准,要求多任务模型同时生成单目3D车辆检测、语义分割与单目深度估计的预测。这些任务对于实现视觉场景的联合2D-3D理解至关重要,尤其在自动驾驶系统开发中。在这一具挑战性的基准上,我们的多任务模型相比单任务最优方法展现出强劲性能,并在具挑战性的3D检测与深度估计任务上确立了新的SOTA结果。

关键词

引用

@article{arxiv.2304.00971,
  title  = {Joint 2D-3D Multi-Task Learning on Cityscapes-3D: 3D Detection, Segmentation, and Depth Estimation},
  author = {Hanrong Ye and Dan Xu},
  journal= {arXiv preprint arXiv:2304.00971},
  year   = {2023}
}

备注

A supplementary document for "TaskPrompter: Spatial-Channel Multi-Task Prompting for Dense Scene Understanding" accepted by ICLR 2023. Project page: https://github.com/prismformore/Multi-Task-Transformer/tree/main/TaskPrompter