中文

基于 CLIP 条件的扩散 Transformer 图像到图像翻译

计算机视觉与模式识别 2026-02-06 v2

摘要

图像到图像翻译旨在学习源域和目标域之间的映射,使能够实现诸如风格迁移、外观转换和域适应等任务。本文探索了基于扩散的框架进行图像到图像翻译,通过适应 Diffusion Transformers (DiT),该方法将扩散模型的去噪能力与变换器的全局建模能力相结合。为引导翻译过程,我们依据来自预训练 CLIP 编码器提取的图像嵌入进行条件控制,允许在不依赖文本或类别标签的情况下实现细粒度且结构一致的翻译。我们在训练期间整合了 CLIP 相似性损失以确保语义一致性,以及 LPIPS 感知损失以增强视觉保真度。我们在两个基准数据集上对 our 方法进行了验证:face2comics 将真实人脸翻译为漫画风格插图,以及 edges2shoes 将边缘图翻译为逼真的鞋子图像。实验结果表明,DiT 结合 CLIP 条件和感知相似性目标,能够实现高质量、语义忠实的翻译,为配对图像到图像翻译任务提供了有前景的 GAN-based 模型的替代方案。

关键词

引用

@article{arxiv.2505.16001,
  title  = {Image-to-Image Translation with Diffusion Transformers and CLIP-Based Image Conditioning},
  author = {Qiang Zhu and Kuan Lu and Menghao Huo and Yuxiao Li},
  journal= {arXiv preprint arXiv:2505.16001},
  year   = {2026}
}

备注

Published in: 2025 6th International Conference on Computer Vision, Image and Deep Learning (CVIDL)