QLIP:文本对齐的视觉分词统一自回归多模态理解与生成
计算机视觉与模式识别
2025-02-10 v1
摘要
我们提出了量化语言-图像预训练(QLIP),这是一种视觉分词方法,它结合了最先进的重建质量与最先进的零样本图像理解能力。QLIP 训练一个基于二值球面量化的自编码器,其目标包括重建和语言-图像对齐。我们首次证明这两个目标不必相互冲突。我们在训练过程中动态平衡这两个损失项,并展示了一个两阶段训练流程如何有效地将图像-语言预训练的大批量需求与重建目标带来的内存瓶颈结合起来。我们验证了 QLIP 在单一模型中进行多模态理解和文本条件图像生成的有效性。具体而言,QLIP 可以作为 LLaVA 的视觉编码器和 LlamaGen 的图像分词器的直接替代品,性能相当甚至更优。最后,我们证明 QLIP 能够实现一个统一的混合模态自回归模型,用于理解与生成。
引用
@article{arxiv.2502.05178,
title = {QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation},
author = {Yue Zhao and Fuzhao Xue and Scott Reed and Linxi Fan and Yuke Zhu and Jan Kautz and Zhiding Yu and Philipp Krähenbühl and De-An Huang},
journal= {arXiv preprint arXiv:2502.05178},
year = {2025}
}
备注
Tech report. Project page: https://nvlabs.github.io/QLIP/