中文

一种用于多任务视觉感知的动态特征交互框架

计算机视觉与模式识别 2023-06-09 v1

摘要

多任务视觉感知在场景理解(如自动驾驶)中具有广泛应用。在本工作中,我们设计了一个高效的统一框架来解决多个常见的感知任务,包括实例分割、语义分割、单目3D检测和深度估计。简单地为这些任务共享相同的视觉特征表示会损害任务性能,而独立的任务特定特征提取器会导致参数冗余和延迟。因此,我们设计了两个特征融合分支来学习特征基,这些特征基对多个感知任务有用从而被共享。随后,每个任务将相应的特征基作为预测任务头的输入以完成特定任务。特别地,一个特征融合分支为实例级识别设计,另一个为密集预测设计。为增强分支间通信,实例分支利用高效的动态卷积加权将每个实例的像素级空间信息传递给密集分支。此外,提出了一个简单但有效的动态路由机制,以隔离任务特定特征并利用任务间的共性。我们提出的框架称为D2BNet,展示了一种用于多任务感知的参数高效预测的独特方法。此外,由于任务间受益于协同训练,我们的方案在nuScenes的部分标注设定下取得了相当的结果,并在Cityscapes数据集全监督下的3D检测和深度估计上优于先前工作。

关键词

引用

@article{arxiv.2306.05061,
  title  = {A Dynamic Feature Interaction Framework for Multi-task Visual Perception},
  author = {Yuling Xi and Hao Chen and Ning Wang and Peng Wang and Yanning Zhang and Chunhua Shen and Yifan Liu},
  journal= {arXiv preprint arXiv:2306.05061},
  year   = {2023}
}

备注

Accepted by International Journal of Computer Vision. arXiv admin note: text overlap with arXiv:2011.09796