中文

IRGPT:基于大规模基准的双跨模态课程学习理解真实红外图像

计算机视觉与模式识别 2025-07-22 v1

摘要

真实的红外图像为视觉语言模型带来了独特挑战,主要由于稀缺的对齐文本数据和领域特定特征。尽管已有方法已推进了该领域,但它们依赖于通过可见图像风格迁移生成的合成红外图像,这限制了其捕捉红外模态独特特征的能力。为此,我们提出 IRGPT,这是第一个用于真实红外图像的多模态大语言模型,基于由超过 26 万个真实图像-文本对组成的大规模红外-文本数据集 (IR-TD) 构建。所提出的 IR-TD 数据集包含真实红外图像与精心构建的文本配对,其中初始草稿来源于两种互补过程:(1) 基于可见图像的 LLM 生成描述,(2) 基于注释的规则生成描述。此外,我们引入一种双跨模态课程迁移学习策略,通过考虑红外-可见和红外-文本的难度分数,系统性地将可见领域的知识迁移到红外领域。在由 9 个任务 (如识别、定位) 组成的基准上评估的 IRGPT 达到了与更大规模模型相比的状态-of-the-art 性能。

关键词

引用

@article{arxiv.2507.14449,
  title  = {IRGPT: Understanding Real-world Infrared Image with Bi-cross-modal Curriculum on Large-scale Benchmark},
  author = {Zhe Cao and Jin Zhang and Ruiheng Zhang},
  journal= {arXiv preprint arXiv:2507.14449},
  year   = {2025}
}

备注

11 pages, 7 figures. This paper is accepted by ICCV 2025