中文

Pix2Next:利用视觉基础模型进行RGB到NIR图像转换

计算机视觉与模式识别 2025-04-24 v2 人工智能

摘要

本文提出了Pix2Next,一种新颖的图像到图像转换框架,旨在解决从RGB输入生成高质量近红外(NIR)图像的挑战。我们的方法在编码器-解码器架构中利用了最先进的视觉基础模型(VFM),并结合交叉注意力机制以增强特征融合。该设计捕获了详细的全局表示并保留了基本的光谱特征,将RGB到NIR的转换视为不仅仅是一个简单的域迁移问题。多尺度PatchGAN判别器确保了在各种细节级别上的逼真图像生成,同时精心设计的损失函数将全局上下文理解与局部特征保留相结合。我们在RANUS数据集上进行了实验,以证明Pix2Next在定量指标和视觉质量方面的优势,与现有方法相比,FID分数提高了34.81%。此外,我们通过在使用生成的NIR数据增强有限的真实NIR数据集的下游目标检测任务上展示性能提升,证明了Pix2Next的实用价值。所提出的方法能够在无需额外数据采集或标注工作的情况下扩大NIR数据集的规模,从而有可能加速基于NIR的计算机视觉应用的发展。

关键词

引用

@article{arxiv.2409.16706,
  title  = {Pix2Next: Leveraging Vision Foundation Models for RGB to NIR Image Translation},
  author = {Youngwan Jin and Incheol Park and Hanbin Song and Hyeongjin Ju and Yagiz Nalcakan and Shiho Kim},
  journal= {arXiv preprint arXiv:2409.16706},
  year   = {2025}
}

备注

19 pages,12 figures