中文

基于频率分布的 CycleGAN 图像翻译潜在表示学习

计算机视觉与模式识别 2025-08-06 v1 人工智能 图形学

摘要

本文提出了 Fd-CycleGAN,这是一种图像到图像 (I2I) 翻译框架,通过增强潜在表示学习以逼近真实数据分布。基于 CycleGAN 的基础上,我们的方法集成了局部邻域编码 (LNE) 和频率感知监督,以捕捉细粒度的局部像素语义,同时保持来自源域的结构一致性。我们采用基于分布的损失指标,包括 KL/JS 散度和对数基于相似性度量,显式量化真实生成图像分布在空间和频率域中的对齐程度。为验证 Fd-CycleGAN 的有效性,我们在多样化的数据集上进行实验——Horse2Zebra、Monet2Photo 和合成性增强的 Strike-off 数据集。与基线 CycleGAN 和其他最新方法相比,我们的方法在感知质量、收敛速度和模式多样性方面表现出优势,尤其在数据有限的情境下。通过有效捕捉局部和全局分布特征,Fd-CycleGAN 实现了更具视觉一致性和语义一致性的翻译。我们的结果表明,频率引导的潜在学习显著提高了图像翻译任务中的泛化能力,具有在文件修复、艺术风格迁移和医学图像合成等领域的广阔应用前景。我们还与基于扩散的生成模型进行了比较,突出了本方法在训练效率和定性输出方面的优势。

关键词

引用

@article{arxiv.2508.03415,
  title  = {Learning Latent Representations for Image Translation using Frequency Distributed CycleGAN},
  author = {Shivangi Nigam and Adarsh Prasad Behera and Shekhar Verma and P. Nagabhushan},
  journal= {arXiv preprint arXiv:2508.03415},
  year   = {2025}
}

备注

This paper is currently under review for publication in an IEEE Transactions. If accepted, the copyright will be transferred to IEEE