中文

面向首届 VCL 挑战赛多任务鲁棒性赛道的密集视觉预测通用多任务框架方案

计算机视觉与模式识别 2024-02-28 v1

摘要

在本报告中,我们介绍了针对 ICCV 2023 研讨会首届视觉持续学习(VCL)挑战赛多任务鲁棒性赛道的解决方案。我们提出了一种名为 UniNet 的通用框架,将各种视觉感知算法无缝整合到一个多任务模型中。具体而言,我们分别选用 DETR3D、Mask2Former 和 BinsFormer 来处理 3D 目标检测、实例分割和深度估计任务。最终提交的模型采用 InternImage-L 主干网络,在 SHIFT 验证集上取得了 49.6 的综合得分(29.5 Det mAP、80.3 mTPS、46.4 Seg mAP 和 7.93 silog)。此外,我们在实验中提供了一些有趣的观察结果,可能有助于密集视觉预测中多任务学习的发展。

关键词

引用

@article{arxiv.2402.17319,
  title  = {A Vanilla Multi-Task Framework for Dense Visual Prediction Solution to 1st VCL Challenge -- Multi-Task Robustness Track},
  author = {Zehui Chen and Qiuchen Wang and Zhenyu Li and Jiaming Liu and Shanghang Zhang and Feng Zhao},
  journal= {arXiv preprint arXiv:2402.17319},
  year   = {2024}
}

备注

Technical Report