IF-Bench:面向红外图像的多模态大语言模型基准测试与生成式视觉提示
计算机视觉与模式识别
2025-12-11 v1
摘要
最近的多模态大语言模型(MLLMs)进展显著,但其在理解红外图像方面的能力尚未得到探索。为填补这一空白,我们提出IF-Bench——首个针对红外图像多模态理解的数据集。IF-Bench包含499张来自23个红外数据集的图像,以及680个精心策划的视觉问答对,涵盖图像理解的10个核心维度。基于此基准,我们系统评估了超过40个开源及闭源MLLMs,采用循环评估、双语评估和混合判断策略以提升结果可靠性。我们的分析揭示了模型规模、架构与推理范式对红外图像理解的影响,为该领域提供了宝贵洞察。进一步,我们提出一种无训练的生成式视觉提示(GenViP)方法,利用先进图像编辑模型将红外图像转化为语义与空间上与之对齐的RGB图像,从而缓解域分布偏移。大量实验表明,该方法在广泛的MLLMs上均能显著提升性能。该基准及代码已发布于https://github.com/casiatao/IF-Bench。
引用
@article{arxiv.2512.09663,
title = {IF-Bench: Benchmarking and Enhancing MLLMs for Infrared Images with Generative Visual Prompting},
author = {Tao Zhang and Yuyang Hong and Yang Xia and Kun Ding and Zeyu Zhang and Ying Wang and Shiming Xiang and Chunhong Pan},
journal= {arXiv preprint arXiv:2512.09663},
year = {2025}
}