基于语言引导的 RGB-T 驾驶场景分割框架
计算机视觉与模式识别
2026-02-10 v1 人工智能
机器学习
机器人学
摘要
在恶劣照明、光照和阴影条件下,对道路场景进行稳健的语义分割是自动驾驶应用的核心挑战。RGB-热成像融合是标准方法,但现有方法在所有条件下应用静态融合策略,使得模态特定的噪声在整个网络中传播。因此,我们提出CLARITY,通过动态适应检测到的场景条件来调整融合策略。由视觉语言模型(VLM)先验驱动,网络学习根据照明状态调制每个模态的贡献,并利用对象嵌入进行分割,而不是应用固定的融合策略。我们进一步引入两种机制,即一种保留有效暗对象语义的机制(先前的噪声抑制方法会错误地丢弃),以及一种层次解码器,用于在尺度之间强制结构一致性,以 sharpen 边界。实验在 MFNet 数据集上进行,结果表明CLARITY建立了新的最先进(SOTA),实现了62.3% mIoU和77.5% mAcc。
引用
@article{arxiv.2602.07343,
title = {Seeing Roads Through Words: A Language-Guided Framework for RGB-T Driving Scene Segmentation},
author = {Ruturaj Reddy and Hrishav Bakul Barua and Junn Yong Loo and Thanh Thi Nguyen and Ganesh Krishnasamy},
journal= {arXiv preprint arXiv:2602.07343},
year = {2026}
}