充分利用视觉基础模型深刻先验知识实现 RGB-Depth 驾驶场景通用解析
计算机视觉与模式识别
2025-02-11 v1
摘要
最近的视觉基础模型 (VFM),通常基于视觉转换器 (ViT),在众多计算机视觉任务中取得了显著进展。尽管这些模型在仅关注 RGB 图像的任务中取得了成功,但 VFM 在 RGB-Depth 驾驶场景解析中的潜力仍基本未被探索。本文致力于开发一种可行技术,充分利用 VFM 实现通用的 RGB-Depth 驾驶场景解析。具体地,我们探讨了 RGB 和深度数据固有的特征,提出了一种异构特征集成转换器 (Heterogeneous Feature Integration Transformer, HFIT)。该网络无需重新训练 ViT,即可高效提取和集成全面的异构特征。将 VFM 输出的相对深度预测结果作为 HFIT 侧适配器的输入,克服了对深度图依赖的限制。我们提出的 HFIT 在 Cityscapes 和 KITTI Semantics 数据集上,优于所有传统单模态和数据融合场景解析网络、预训练 VFM 和 ViT 适配器。我们认为,这一新颖策略为 VFM 基于数据融合的驾驶场景解析技术创新之路。我们的源代码已公开于 https://mias.group/HFIT。
引用
@article{arxiv.2502.06219,
title = {Fully Exploiting Vision Foundation Model's Profound Prior Knowledge for Generalizable RGB-Depth Driving Scene Parsing},
author = {Sicen Guo and Tianyou Wen and Chuang-Wei Liu and Qijun Chen and Rui Fan},
journal= {arXiv preprint arXiv:2502.06219},
year = {2025}
}
备注
10 pages, 5 figures