Epsilon-VAE: 将去噪作为视觉解码
计算机视觉与模式识别
2025-05-30 v4 人工智能
图像与视频处理
摘要
在生成建模中,分词将复杂数据简化为紧凑、结构化的表示,创建了一个更高效、更易学习的空间。对于高维视觉数据,它减少了冗余并强调了高质量生成的关键特征。当前的视觉分词方法依赖于传统的自编码器框架,其中编码器将数据压缩为潜在表示,解码器重建原始输入。在这项工作中,我们通过提出将去噪作为解码,从单步重建转向迭代细化,提供了一个新的视角。具体来说,我们将解码器替换为一个扩散过程,该过程在编码器提供的潜在表示的引导下,迭代地细化噪声以恢复原始图像。我们通过评估重建质量(rFID)和生成质量(FID)来评估我们的方法,并将其与最先进的自编码方法进行比较。通过采用扩散的迭代重建,我们的自编码器,即Epsilon-VAE,实现了高重建质量,这反过来在相同压缩率下将下游生成质量提高了22%,或者通过提高压缩率实现了2.3倍的推理加速。我们希望这项工作能为整合迭代生成和自编码以改进压缩和生成提供新的见解。
引用
@article{arxiv.2410.04081,
title = {Epsilon-VAE: Denoising as Visual Decoding},
author = {Long Zhao and Sanghyun Woo and Ziyu Wan and Yandong Li and Han Zhang and Boqing Gong and Hartwig Adam and Xuhui Jia and Ting Liu},
journal= {arXiv preprint arXiv:2410.04081},
year = {2025}
}
备注
Accepted to ICML 2025. v2: added comparisons to SD-VAE and more visual results; v3: minor change to title; v4: camera-ready version