DA-VAE:基于细节对齐的扩散模型插值压缩
计算机视觉与模式识别
2026-03-24 v1
摘要
降低token数量对于高分辨率潜在扩散模型的高效训练和推理至关重要。常见策略是构建高压缩率的图像token化器,但仅用于重建训练的高维潜在空间常丢失有效结构,导致扩散训练困难。现有方法通过语义对齐或选择性丢弃等额外目标来缓解,但通常需要昂贵的扩散 retraining。预训练扩散模型已展现出结构化的低维潜在空间,因此更简洁的思路是扩大潜在维数而保留该结构。我们提出了细节对齐变分自编码器(DA-VAE),仅通过轻量级适配预训练扩散模型主干即可提高VAE的压缩比。DA-VAE采用显式潜在布局:前C个通道直接来自基线分辨率下的预训练VAE,剩余D个通道编码更高分辨率的细节。简易的细节对齐机制鼓励扩展后的潜在空间保留原始结构。结合温暖启动微调策略,我们的方法在5个H100天内即可实现Stable Diffusion 3.5的1024×1024图像生成,仅需32×32个token,较原始模型降低4倍;进一步实现2048×2048生成,加速6倍且保持图像质量。我们还在ImageNet上对方法及设计选择进行了量化验证。
引用
@article{arxiv.2603.22125,
title = {DA-VAE: Plug-in Latent Compression for Diffusion via Detail Alignment},
author = {Xin Cai and Zhiyuan You and Zhoutong Zhang and Tianfan Xue},
journal= {arXiv preprint arXiv:2603.22125},
year = {2026}
}
备注
CVPR 2026