中文

VQRAE:用于多模态理解、生成和重构的表示量化自编码器

人工智能 2025-12-01 v1

摘要

在构建统一模型以实现多模态理解、生成和重构表示的单一标记化器方面,这仍然是一个关键挑战。以往的研究主要尝试在双编码器范式中解决此问题,例如利用分别用于理解和生成的独立编码器,或通过对比损失平衡语义表示和低层特征。在本文中,我们提出了 VQRAE,即 Representation AutoEncoders 的向量量化版本,这是首次探索在统一标记化器中产生用于图像理解的连续语义特征以及用于视觉生成的离散标记。具体而言,我们基于预训练的视觉基础模型,构建对称的 ViT 解码器,并采用两阶段训练策略:首先,冻结编码器并以像素重构目标学习高维语义 VQ 码本;随后,联合优化编码器以自蒸馏约束。这种设计使我们能够在保持多模态理解能力的同时,获得兼容生成的离散标记以及精细的重构。此外,我们识别出在量化依赖高维码本的语义编码器时,与以往在图像重构中使用低维码本的常见做法相反的有趣属性。语义 VQ 码本在 1536 维度上可实现 100% 的利用率。VQRAE 在多个视觉理解、生成和重构基准上表现出竞争性能,并在自回归范式中展现出其离散优势的良好扩展性能。

关键词

引用

@article{arxiv.2511.23387,
  title  = {Hierarchical AI-Meteorologist: LLM-Agent System for Multi-Scale and Explainable Weather Forecast Reporting},
  author = {Daniil Sukhorukov and Andrei Zakharov and Nikita Glazkov and Katsiaryna Yanchanka and Vladimir Kirilin and Maxim Dubovitsky and Roman Sultimov and Yuri Maksimov and Ilya Makarov},
  journal= {arXiv preprint arXiv:2511.23387},
  year   = {2025}
}

备注

9 pages, 4 figures