中文

TC-AE:释放深度压缩自编码器的 Token 容量

计算机视觉与模式识别 2026-04-09 v1

摘要

我们提出了 TC-AE,一种基于 ViT 的深度压缩自编码器架构。现有方法通常通过增加潜在表示的通道数来在高压缩比下保持重建质量。然而,这种策略往往导致潜在表示坍缩,从而降低生成性能。TC-AE 并未依赖日益复杂的架构或多阶段训练方案,而是从 token 空间(即像素与图像潜在表示之间的关键桥梁)的角度出发,通过两个互补的创新来解决这一挑战:首先,我们通过调整 ViT 中的 patch 大小来研究 token 数量缩放,并在固定潜在预算下识别出激进的 token 到潜在压缩是限制有效缩放的关键因素。为解决这一问题,我们将 token 到潜在压缩分解为两个阶段,减少结构信息损失,从而实现有效的 token 数量缩放以用于生成。其次,为进一步缓解潜在表示坍缩,我们通过联合自监督训练增强图像 token 的语义结构,从而生成更有利于生成的潜在表示。通过这些设计,TC-AE 在深度压缩下实现了显著提升的重建和生成性能。我们希望我们的研究能够推动基于 ViT 的视觉生成 tokenizer 的发展。

关键词

引用

@article{arxiv.2604.07340,
  title  = {TC-AE: Unlocking Token Capacity for Deep Compression Autoencoders},
  author = {Teng Li and Ziyuan Huang and Cong Chen and Yangfu Li and Yuanhuiyi Lyu and Dandan Zheng and Chunhua Shen and Jun Zhang},
  journal= {arXiv preprint arXiv:2604.07340},
  year   = {2026}
}