面向不良环境深度估计的多模态驱动 LoRA
计算机视觉与模式识别
2024-12-31 v1
摘要
自动驾驶领域日益关注解决与驾驶安全相关的棘手问题,尤其是针对不良环境(如夜间、雾天、雨天)下的安全问题。为此,针对不良环境深度估计 (ACDE) 的任务受到广泛关注。以往的 ACDE 方法主要依赖生成模型,需要额外的目标图像将晴间图像转换为恶劣天气,或使用可学习参数进行特征增强以弥补域间差异,导致模型复杂度和调参工作增加。此外,与基于 CLIP 的方法不同,深度估计模型缺乏足够的多模态特征对齐,阻碍了在恶劣环境下的协同理解。为此,我们提出一种多模态驱动 LoRA (MMD-LoRA),利用低秩适配矩阵从源域高效迁移到目标域。其包含两个核心组件:Prompt Driven Domain Alignment (PDDA) 和 Visual-Text Consistent Contrastive Learning (VTCCL)。在 PDAD 中,带 MMD-LoRA 的图像编码器生成目标域视觉表征,由对齐损失监督,即源域与目标域之间的语言与图像差异应相等。VTCCL 则桥接了 CLIP 中的文本特征与扩散模型中的视觉特征,将不同天气表征(视觉与文本)推远,拉近相似表征。通过大量实验,我们的方法在 nuScenes 和 Oxford RobotCar 数据集上实现了最先进的性能,凸显了在各种恶劣环境下的鲁棒性与效率。
引用
@article{arxiv.2412.20162,
title = {Multi-Modality Driven LoRA for Adverse Condition Depth Estimation},
author = {Guanglei Yang and Rui Tian and Yongqiang Zhang and Zhun Zhong and Yongqiang Li and Wangmeng Zuo},
journal= {arXiv preprint arXiv:2412.20162},
year = {2024}
}