中文

DiffV2IR:基于视觉-语言理解的可见光到红外扩散模型

计算机视觉与模式识别 2025-03-26 v1

摘要

可见光到红外图像翻译(V2IR)任务本质上具有挑战性,主要面临三大障碍:1)实现语义感知的翻译;2)应对红外图像中多样化的波长谱段;3)全面红外数据集的匮乏。当前主流方法倾向于将V2IR视为常规的图像到图像合成问题,常常忽视上述特定难题。为此,我们提出DiffV2IR,一种新颖的图像翻译框架,包含两个关键组件:渐进学习模块(PLM)与视觉-语言理解模块(VLUM)。PLM采用自适应扩散模型架构,利用多阶段知识学习,使红外过渡从全波段逐步聚焦至目标波长。为提升V2IR翻译质量,VLUM融合了统一的视觉-语言理解。我们还构建了一个大规模红外数据集IR-500K,包含50万张涵盖多种场景与物体、在不同环境条件下采集的红外图像。通过PLM、VLUM与大规模IR-500K数据集的结合,DiffV2IR显著提升了V2IR的性能。实验验证了DiffV2IR在生成高质量翻译方面的卓越表现,确立了其有效性与广泛适用性。代码、数据集与DiffV2IR模型将在https://github.com/LidongWang-26/DiffV2IR 提供。

关键词

引用

@article{arxiv.2503.19012,
  title  = {DiffV2IR: Visible-to-Infrared Diffusion Model via Vision-Language Understanding},
  author = {Lingyan Ran and Lidong Wang and Guangcong Wang and Peng Wang and Yanning Zhang},
  journal= {arXiv preprint arXiv:2503.19012},
  year   = {2025}
}

备注

Project page: https://diffv2ir.github.io/