中文

IF-Bench:面向红外图像的多模态大语言模型基准测试与生成式视觉提示

计算机视觉与模式识别 2025-12-11 v1

摘要

最近的多模态大语言模型(MLLMs)进展显著,但其在理解红外图像方面的能力尚未得到探索。为填补这一空白,我们提出IF-Bench——首个针对红外图像多模态理解的数据集。IF-Bench包含499张来自23个红外数据集的图像,以及680个精心策划的视觉问答对,涵盖图像理解的10个核心维度。基于此基准,我们系统评估了超过40个开源及闭源MLLMs,采用循环评估、双语评估和混合判断策略以提升结果可靠性。我们的分析揭示了模型规模、架构与推理范式对红外图像理解的影响,为该领域提供了宝贵洞察。进一步,我们提出一种无训练的生成式视觉提示(GenViP)方法,利用先进图像编辑模型将红外图像转化为语义与空间上与之对齐的RGB图像,从而缓解域分布偏移。大量实验表明,该方法在广泛的MLLMs上均能显著提升性能。该基准及代码已发布于https://github.com/casiatao/IF-Bench。

关键词

引用

@article{arxiv.2512.09663,
  title  = {IF-Bench: Benchmarking and Enhancing MLLMs for Infrared Images with Generative Visual Prompting},
  author = {Tao Zhang and Yuyang Hong and Yang Xia and Kun Ding and Zeyu Zhang and Ying Wang and Shiming Xiang and Chunhong Pan},
  journal= {arXiv preprint arXiv:2512.09663},
  year   = {2025}
}