中文

Layton:用于 1024 像素图像重建与生成的 256 Token 潜在一致性分词器

计算机视觉与模式识别 2025-03-17 v3

摘要

图像分词极大地推动了视觉生成和多模态建模的发展,尤其是与自回归模型结合时。然而,当前方法在平衡效率和保真度方面面临挑战:高分辨率图像重建要么需要过多的 token,要么通过减少 token 数量而损害关键细节。为了解决这一问题,我们提出了潜在一致性分词器(Layton),它将离散视觉 token 与预训练的潜在扩散模型(LDM)的紧凑潜在空间连接起来,仅使用 256 个 token 即可高效表示 1024x1024 图像——相比 VQGAN 实现了 16 倍的压缩。Layton 集成了 Transformer 编码器、量化码本和潜在一致性解码器。直接将 LDM 用作解码器会导致颜色和亮度差异。因此,我们将其转换为潜在一致性解码器,将多步采样减少至 1-2 步,以进行直接的像素级监督。实验证明了 Layton 在高保真重建方面的优越性,在 MSCOCO-2017 5K 基准测试上,1024x1024 图像重建的重建 Frechet Inception Distance 为 10.8。我们还将 Layton 扩展为自回归工作的文本到图像生成模型 LaytonGen。它在 GenEval 基准测试上取得了 0.73 的分数,超越了当前 SOTA 方法。项目主页:https://github.com/OPPO-Mente-Lab/Layton

关键词

引用

@article{arxiv.2503.08377,
  title  = {Layton: Latent Consistency Tokenizer for 1024-pixel Image Reconstruction and Generation by 256 Tokens},
  author = {Qingsong Xie and Zhao Zhang and Zhe Huang and Yanhao Zhang and Haonan Lu and Zhenyu Yang},
  journal= {arXiv preprint arXiv:2503.08377},
  year   = {2025}
}