中文

基于语言引导的 RGB-T 驾驶场景分割框架

计算机视觉与模式识别 2026-02-10 v1 人工智能 机器学习 机器人学

摘要

在恶劣照明、光照和阴影条件下,对道路场景进行稳健的语义分割是自动驾驶应用的核心挑战。RGB-热成像融合是标准方法,但现有方法在所有条件下应用静态融合策略,使得模态特定的噪声在整个网络中传播。因此,我们提出CLARITY,通过动态适应检测到的场景条件来调整融合策略。由视觉语言模型(VLM)先验驱动,网络学习根据照明状态调制每个模态的贡献,并利用对象嵌入进行分割,而不是应用固定的融合策略。我们进一步引入两种机制,即一种保留有效暗对象语义的机制(先前的噪声抑制方法会错误地丢弃),以及一种层次解码器,用于在尺度之间强制结构一致性,以 sharpen 边界。实验在 MFNet 数据集上进行,结果表明CLARITY建立了新的最先进(SOTA),实现了62.3% mIoU和77.5% mAcc。

关键词

引用

@article{arxiv.2602.07343,
  title  = {Seeing Roads Through Words: A Language-Guided Framework for RGB-T Driving Scene Segmentation},
  author = {Ruturaj Reddy and Hrishav Bakul Barua and Junn Yong Loo and Thanh Thi Nguyen and Ganesh Krishnasamy},
  journal= {arXiv preprint arXiv:2602.07343},
  year   = {2026}
}