中文

CM-Diff:红外与可见光图像间双向跨模态翻译扩散模型的单一生成网络

计算机视觉与模式识别 2025-08-08 v2

摘要

图像翻译是缓解红外与可见光模态信息缺失的关键方法之一,同时也有助于增强模态特定数据集。然而,现有的红外与可见光图像翻译方法要么实现单向模态翻译,要么依赖循环一致性进行双向模态翻译,这可能导致次优性能。在本工作中,我们提出了双向跨模态翻译扩散模型(CM-Diff),用于同时建模红外与可见光两种模态中的数据分布。我们通过结合训练期间的翻译方向标签指导与跨模态特征控制来解决这一挑战。具体而言,我们将两种模态之间映射关系的建立视为学习数据分布和理解模态差异的过程,通过一种新颖的双向扩散训练(BDT)实现。此外,我们提出统计约束推理(SCI)以确保生成的图像紧密遵循目标模态的数据分布。实验结果证明了 CM-Diff 相较于最先进方法的优越性,突出了其在生成双模态数据集方面的潜力。

关键词

引用

@article{arxiv.2503.09514,
  title  = {CM-Diff: A Single Generative Network for Bidirectional Cross-Modality Translation Diffusion Model Between Infrared and Visible Images},
  author = {Bin Hu and Chenqiang Gao and Shurui Liu and Junjie Guo and Fang Chen and Fangcen Liu and Junwei Han},
  journal= {arXiv preprint arXiv:2503.09514},
  year   = {2025}
}