中文

PixelShuffler:通过像素重排实现简单图像翻译

计算机视觉与模式识别 2025-02-06 v2 图像与视频处理

摘要

图像到图像的翻译是计算机视觉中的一个话题,涉及从医学图像翻译(如将 MRI 扫描转换为 CT 扫描或其他 MRI 对比度)到图像上色、超分辨率、领域适应以及从草图或语义图生成照片级图像等广泛应用场景。图像风格迁移也是图像到图像翻译中被广泛研究的应用,其目标是合成一种将一张图像的内容与另一张图像的风格相结合的图像。现有的最新方法通常依赖复杂的神经网络,包括扩散模型和语言模型,才能实现高质量的风格迁移,但这些方法计算成本高且实施复杂。本文提出了一种新颖的像素shuffle方法,用于解决图像到图像翻译问题,具体以风格迁移中的示范应用为例。该方法通过将风格图像的像素重新排列,以最大化重排后图像与内容图像之间的互信息来实现风格迁移。该方法本质上保留了风格图像的颜色,同时确保风格化输出中保留内容图像的结构细节。我们表明,这种简单而直接的方法在内容保留方面的 Learned Perceptual Image Patch Similarity (LPIPS) 损失以及风格相似性的 Fréchet Inception Distance (FID) 分数方面,能够与最新技术相媲美。我们的实验验证了该像素shuffle方法在显著降低复杂度的同时实现了竞争性能,为高效图像风格迁移以及该方法在更广泛图像到图像翻译任务中的可行性提供了前景。

关键词

引用

@article{arxiv.2410.03021,
  title  = {PixelShuffler: A Simple Image Translation Through Pixel Rearrangement},
  author = {Omar Zamzam},
  journal= {arXiv preprint arXiv:2410.03021},
  year   = {2025}
}