ThermEval: 面向热力学图像的视觉语言模型评估基准
计算机视觉与模式识别
2026-02-17 v1 人工智能
机器学习
摘要
视觉语言模型(VLMs)在RGB图像上取得了强大的性能,但它们无法很好地推广到热图像。热力学感知在可见光失败的场景中发挥着关键作用,包括夜间监视、搜救、自动驾驶和医学筛查。不同于RGB图像,热图像编码的是物理温度而非颜色或纹理,需要超越现有RGB中心基准所不评估的感知和推理能力。我们引入ThermEval-B,这是一个约55,000对热力学视觉问答对的结构化基准,旨在评估热力学视觉语言理解所需的基础原语。ThermEval-B整合了公开数据集与我们新收集的ThermEval-D,这是第一个提供稠密像素级温度图并带有语义身体部位注释的数据集,覆盖多样的室内和户外环境。评估25个开源和闭源VLMs,我们发现模型在温度关联推理上总是失败, 在热力学色彩变换下性能下降,倾向于依赖语言先验或固定响应,仅在提示或监督微调方面获得有限的提升。这些结果表明,热力学理解需要超越RGB假设的专门评估,使ThermEval成为推动热力学视觉语言建模进展的基准。
引用
@article{arxiv.2602.14989,
title = {ThermEval: A Structured Benchmark for Evaluation of Vision-Language Models on Thermal Imagery},
author = {Ayush Shrivastava and Kirtan Gangani and Laksh Jain and Mayank Goel and Nipun Batra},
journal= {arXiv preprint arXiv:2602.14989},
year = {2026}
}
备注
8 Pages with 2 figures of main content. 2 pages of References. 10 pages of appendix with 6 figures