人类洞察驱动的潜在空间用于不同驾驶视角:用于高效多任务推理的统一编码器
计算机视觉与模式识别
2026-04-03 v3
摘要
自动驾驶系统需要对环境有全面的了解,这通过提取对感知、规划和控制至关重要的视觉特征来实现。然而,仅在单任务目标或通用数据集上训练的模型,通常缺乏在复杂驾驶场景中实现稳健性能所需的上下文信息。本文中,我们提出了一种统一编码器,其在对于城市驾驶至关重要的多个计算机视觉任务上进行训练,包括深度、位姿和 3D 场景流估计,以及语义、实例、全景和运动分割。通过整合这些多样的视觉线索——类似于人类感知机制——该编码器捕获了丰富的特征,从而增强了与导航相关的预测。我们以转向估计作为下游任务,利用其密集的潜在空间对该模型进行评估。为确保高效的多任务学习,我们引入了用于位姿估计的多尺度特征网络,并应用了来自多骨干网络教师模型的知识蒸馏。我们的研究结果突出了两个关键发现: 统一编码器在所有视觉感知任务中均取得了具有竞争力的性能,展现出强大的泛化能力; 对于转向估计,利用密集潜在表示的冻结统一编码器,其表现优于其微调版本以及在 ImageNet 等通用数据集上预训练的同一冻结模型。这些结果强调了任务特定视觉特征的重要性,并展示了多任务学习在推进自动驾驶系统方面的潜力。更多细节和预训练模型可在 https://hi-computervision.github.io/uni-encoder/ 获取。
引用
@article{arxiv.2409.10095,
title = {Human Insights Driven Latent Space for Different Driving Perspectives: A Unified Encoder for Efficient Multi-Task Inference},
author = {Huy-Dung Nguyen and Anass Bairouk and Mirjana Maras and Wei Xiao and Tsun-Hsuan Wang and Patrick Chareyre and Ramin Hasani and Marc Blanchon and Daniela Rus},
journal= {arXiv preprint arXiv:2409.10095},
year = {2026}
}