TRIDE:一种用于深度估计的文本辅助雷达-图像天气感知融合网络
计算机视觉与模式识别
2025-08-19 v2
摘要
深度估计对于自动驾驶至关重要,旨在解析车辆周围的三维环境。雷达传感器以其成本效益和鲁棒性而闻名,其发展激发了人们对基于雷达-相机融合的解决方案的兴趣。然而,现有算法在融合这些模态的特征时并未考虑天气条件,尽管已知雷达在恶劣天气下比相机更鲁棒。此外,虽然视觉-语言模型发展迅速,但利用语言描述与其他模态进行深度估计仍然是一个开放的挑战。本文首先引入了一种文本生成策略以及特征提取和融合技术,可以辅助单目深度估计流程,从而在 KITTI 数据集上提高了不同算法的准确性。在此基础上,我们提出了 TRIDE,这是一种雷达-相机融合算法,通过整合雷达点信息来增强文本特征提取。为了解决天气对传感器性能的影响,我们引入了一个天气感知融合模块,该模块能根据当前天气条件自适应地调整雷达权重。我们的方法在 nuScenes 数据集上进行了基准测试,表现出优于最先进技术的性能提升,在 MAE 上实现了 12.87% 的改进,在 RMSE 上实现了 9.08% 的改进。代码:https://github.com/harborsarah/TRIDE
引用
@article{arxiv.2508.08038,
title = {TRIDE: A Text-assisted Radar-Image weather-aware fusion network for Depth Estimation},
author = {Huawei Sun and Zixu Wang and Hao Feng and Julius Ott and Lorenzo Servadei and Robert Wille},
journal= {arXiv preprint arXiv:2508.08038},
year = {2025}
}
备注
Accepted by TMLR (2025.08)