高效扩散的层压表示自动编码器
计算机视觉与模式识别
2026-02-05 v1
摘要
最近的研究表明,扩散模型可通过直接在 SSL patch features 上操作而非像素空间 latent 来生成高质量图像。然而,来自 DINOv2 等编码器的稠密 patch 网格包含显著冗余,使得扩散计算不必要地昂贵。我们引入 FlatDINO,一种变分自动编码器,将该表示压缩为仅 32 个连续 token 的一维序列——序列长度降低 8 倍,总维度压缩 48 倍。在 ImageNet 256x256 上,使用 FlatDINO latent 训练的 DiT-XL 在 classifier-free guidance 下实现 gFID 为 1.80,每个前向传播所需 FLOPs 减少 8 倍,训练步骤 FLOPs 最多减少 4.5 倍。这些是初步结果,本工作仍在进行中。
引用
@article{arxiv.2602.04873,
title = {Laminating Representation Autoencoders for Efficient Diffusion},
author = {Ramón Calvo-González and François Fleuret},
journal= {arXiv preprint arXiv:2602.04873},
year = {2026}
}