视觉样例驱动的任务提示用于自动驾驶中的统一感知
计算机视觉与模式识别
2023-03-06 v1
摘要
多任务学习已成为一种强大的范式,能够同时解决一系列任务,并在计算资源和推理时间上具有良好的效率。然而,这些算法大多针对自动驾驶范围之外的不同任务设计,因此难以在自动驾驶中比较多任务方法。为了实现对当前多任务学习方法在自动驾驶中的全面评估,我们广泛研究了流行多任务方法在大规模驾驶数据集上的性能,该数据集涵盖四个常见感知任务,即目标检测、语义分割、可行驶区域分割和车道检测。我们在不同常见设置下对当前多任务学习方法进行了深入分析,发现现有方法取得了进展,但与单任务基线相比仍存在较大性能差距。为缓解自动驾驶中的这一困境,我们提出了一种有效的多任务框架 VE-Prompt,它通过任务特定提示引入视觉样例,引导模型学习高质量的任务特定表示。具体而言,我们基于边界框和基于颜色的标记生成视觉样例,其提供了目标类别的准确视觉外观并进一步缩小了性能差距。此外,我们桥接了基于 transformer 的编码器与卷积层,以实现自动驾驶中高效且准确的统一感知。在多样化自动驾驶数据集 BDD100K 上的综合实验结果表明,VE-Prompt 改进了多任务基线并进一步超越了单任务模型。
引用
@article{arxiv.2303.01788,
title = {Visual Exemplar Driven Task-Prompting for Unified Perception in Autonomous Driving},
author = {Xiwen Liang and Minzhe Niu and Jianhua Han and Hang Xu and Chunjing Xu and Xiaodan Liang},
journal= {arXiv preprint arXiv:2303.01788},
year = {2023}
}
备注
Accepted at CVPR 2023