中文

超越最后一层:用于视觉分词的多层表示融合

计算机视觉与模式识别 2026-05-13 v2 人工智能

摘要

使用冻结预训练视觉编码器作为视觉分词器的表示自动编码器已实现强大的重构和生成质量。然而,现有方法仅从最后一个编码器层提取特征,弃用了分布在中间层的丰富层次信息。我们表明,低层视觉细节仅以衰减残差形式存活于最后一个层中,经过多层语义抽象后;显式融合多层特征可显著恢复这些丢失的信息。我们提出DRoRAE(Depth-Routed Representation AutoEncoder),一个轻量级融合模块,通过能量受限路由和增量纠正自适应地聚合所有编码器层,产生与冻结预训练解码器兼容的丰富latent。我们的训练策略分为三个阶段:首先在冻结解码器的隐式分布约束下学习融合,然后微调解码器以充分利用丰富的表示。在ImageNet-256上,DRoRAE将rFID从0.57降至0.29,改进生成FID从1.74降至1.65(使用AutoGuidance), gains 也转移到文本到图像合成。此外,我们发现融合容量与重构质量之间存在对数线性比例关系(R2=0.86R^2{=}0.86),确定“表示丰富性”作为一种新的、可预测可扩展的维度,用于视觉分词器,类似于NLP中的词汇大小。

关键词

引用

@article{arxiv.2605.10780,
  title  = {Beyond the Last Layer: Multi-Layer Representation Fusion for Visual Tokenization},
  author = {Xuanyu Zhu and Yan Bai and Yang Shi and Yihang Lou and Yuanxing Zhang and Jing Jin and Yuan Zhou},
  journal= {arXiv preprint arXiv:2605.10780},
  year   = {2026}
}