Thermo-VL:将视觉-语言模型扩展到热红外感知
计算机视觉与模式识别
2026-05-22 v1
摘要
视觉-语言模型 (VLM) 在低光照条件下往往失败,因为其视觉 grounding 主要是从 RGB 图像中学习的,而热红外图像在可见线索减弱时保留着互补的场景结构。我们提出 Thermo-VL,一个感知波长的 VLM,通过可训练的热编码器和文本引导的双注意力融合模块来扩展冻结的 Molmo-7B 主干网络。给定对齐的 RGB 标记、热标记和提示嵌入,融合模块将热特征条件化于语言和 RGB 上下文,然后将带门控残差注入冻结的 RGB 流,以便在不破坏 Molmo 预训练的 RGB-语言接口的情况下整合热证据。我们使用标准语言建模目标进行模型训练,同时引入额外的对齐和正则化损失,以改进跨模态 grounding 并减少对 RGB 的过度依赖。我们还引入了一个像素对齐的 RGB-热指令调优数据集和 Thermo-VL-Bench,一个为低光照和跨光谱推理筛选的 RGB-热 VQA 档案基准。实验显示在具有挑战性的热图像和 RGB+热推理任务上实现显著提升,凸显了提示条件化多光谱融合的价值。我们的数据集和代码已公开提供于: https://thusharakart.github.io/Thermo-VL
引用
@article{arxiv.2605.21882,
title = {Thermo-VL: Extending Vision-Language Models to Thermal Infrared Perception},
author = {Rusiru Thushara and Yasiru Ranasinghe and Jay Paranjape and Vishal M. Patel},
journal= {arXiv preprint arXiv:2605.21882},
year = {2026}
}
备注
18 pages, 11 figures