DecQ:用于增强表示自编码器重构和生成的细节压缩查询
计算机视觉与模式识别
2026-05-22 v1
摘要
表示自编码器(RAEs)利用冻结的视觉基础模型(VFMs)作为 tokenizer 编码器,提供稳健的高级表征,促进潜在扩散模型中的快速收敛和高质量生成。然而,冻结 VFMs 本质上限制了其空间重构能力,限制了细粒度生成和图像编辑;相反,通过微调纠入重建导向信号会破坏预训练的语义空间并降低生成保真度。为解决这一权衡,本文提出了 DecQ 框架。具体而言,DecQ 引入轻量级细节压缩查询,通过 condenser 模块从中间 VFM 特征中提取细粒度信息。这些查询被整合到解码器中以支持重建,并与 patch token 同时生成以进行生成建模。通过来自浅层和深层图层的信息聚合,DecQ 有效缓解了重建-生成权衡,提高了重构质量和生成性能。我们的实验表明:(1)仅通过 8 个额外查询和 3.9% 的额外计算,DecQ 超过基于冻结 DINOv2 的 RAE 实现了更好的重构,将 PSNR 从 19.13 dB 提升到 22.76 dB;(2)对于生成建模,DecQ 比 RAE 实现了 3.3 倍更快的收敛速度,达到了在无引导下 FID 为 1.41,带引导下为 1.05。
引用
@article{arxiv.2605.22777,
title = {DecQ: Detail-Condensing Queries for Enhanced Reconstruction and Generation in Representation Autoencoders},
author = {Tianhang Wang and Yitong Chen and Wei Song and Zuxuan Wu and Min Li and Jiaqi Wang},
journal= {arXiv preprint arXiv:2605.22777},
year = {2026}
}