中文

高效扩散的层压表示自动编码器

计算机视觉与模式识别 2026-02-05 v1

摘要

最近的研究表明,扩散模型可通过直接在 SSL patch features 上操作而非像素空间 latent 来生成高质量图像。然而,来自 DINOv2 等编码器的稠密 patch 网格包含显著冗余,使得扩散计算不必要地昂贵。我们引入 FlatDINO,一种变分自动编码器,将该表示压缩为仅 32 个连续 token 的一维序列——序列长度降低 8 倍,总维度压缩 48 倍。在 ImageNet 256x256 上,使用 FlatDINO latent 训练的 DiT-XL 在 classifier-free guidance 下实现 gFID 为 1.80,每个前向传播所需 FLOPs 减少 8 倍,训练步骤 FLOPs 最多减少 4.5 倍。这些是初步结果,本工作仍在进行中。

关键词

引用

@article{arxiv.2602.04873,
  title  = {Laminating Representation Autoencoders for Efficient Diffusion},
  author = {Ramón Calvo-González and François Fleuret},
  journal= {arXiv preprint arXiv:2602.04873},
  year   = {2026}
}