视频任务十项全能:自动驾驶中图像与视频任务的统一
计算机视觉与模式识别
2023-11-28 v2
摘要
在动态场景中执行多个异构视觉任务是人类感知能力的标志。尽管通过表征学习在图像和视频识别方面取得了显著进展,当前研究仍侧重于为单一、同质或简单组合的任务设计专用网络。我们转而探索为自动驾驶中具有重要输入和输出结构的代表性图像与视频识别任务构建统一模型。为支持此类研究,我们设计了一项新挑战——视频任务十项全能(VTD),其包含十项代表性的图像和视频任务,涵盖物体与像素的分类、分割、定位和关联。在 VTD 上,我们开发了统一网络 VTDNet,其对所有十项任务使用单一结构和一组权重。VTDNet 将相似任务分组,并采用任务交互阶段在任务组内和组间交换信息。鉴于在所有帧上标注所有任务的不实用性,以及多任务联合训练带来的性能下降,我们设计了课程训练、伪标注与微调(CPF)方案,以成功在所有任务上训练 VTDNet 并缓解性能损失。借助 CPF,VTDNet 在大多数任务上显著优于其单任务对应模型,而总体计算量仅为其 20%。VTD 是探索自动驾驶感知任务统一的一个有前景的新方向。
引用
@article{arxiv.2309.04422,
title = {Video Task Decathlon: Unifying Image and Video Tasks in Autonomous Driving},
author = {Thomas E. Huang and Yifan Liu and Luc Van Gool and Fisher Yu},
journal= {arXiv preprint arXiv:2309.04422},
year = {2023}
}
备注
ICCV 2023, project page at https://www.vis.xyz/pub/vtd