CycleVAR:重用自回归模型实现无监督单步图像翻译
摘要
当前的 conditional autoregressive image generation 方法在 results 方面显示出前景,但其在 practical unsupervised image translation 领域的潜力 remains largely unexplored,该领域 operates without explicit cross-domain correspondences。一个 critical limitation 源于 traditional Vector Quantization-based frameworks 中的 discrete quantization,这 disrupts Variational Autoencoder 解码器与 causal Transformer 之间的 gradient flow, impeding end-to-end optimization during adversarial training in image space。为解决这一问题,我们提出使用 Softmax Relaxed Quantization,一种 novel approach 将 codebook selection reformulates 为 continuous probability mixing process via Softmax,从而 preserving gradient propagation。基于此 differentiable foundation,我们引入 CycleVAR,将 image-to-image translation reformulates 为 image-conditional visual autoregressive generation by injecting multi-scale source image tokens as contextual prompts,类似于 language models 中的 prefix-based conditioning。CycleVAR exploits two modes to generate target image tokens,包括 (1) serial multi-step generation, enabling iterative refinement across scales,和 (2) parallel one-step generation,synthesizing all resolution outputs in single forward pass。实验结果表明,parallel one-step generation mode 在 unsupervised scenarios 中 获得 更好的 translation quality with 更快的 inference speed。此外,quantitative and qualitative results indicate that CycleVAR 超越了 previous state-of-the-art unsupervised image translation models,例如 CycleGAN-Turbo。
引用
@article{arxiv.2506.23347,
title = {CycleVAR: Repurposing Autoregressive Model for Unsupervised One-Step Image Translation},
author = {Yi Liu and Shengqian Li and Zuzeng Lin and Feng Wang and Si Liu},
journal= {arXiv preprint arXiv:2506.23347},
year = {2025}
}
备注
Accepted to ICCV 2025. Code available at: https://github.com/IamCreateAI/CycleVAR