TokLIP:将视觉 Token 与 CLIP 结合以实现多模态理解与生成
计算机视觉与模式识别
2025-08-18 v2 人工智能
计算与语言
摘要
Chameleon 和 Emu3 等开创性的基于 token 的工作为多模态统一奠定了基础,但面临高训练计算开销和由于缺乏高层语义而导致的理解性能有限的挑战。在本文中,我们引入了 TokLIP,一种通过语义化向量量化(VQ)token 并融入 CLIP 级别语义来增强理解的视觉 tokenizer,同时允许使用标准 VQ token 进行端到端多模态自回归训练。TokLIP 将低层离散 VQ tokenizer 与基于 ViT 的 token 编码器相结合,以捕获高层连续语义。与之前的方法(例如 VILA-U)不同,TokLIP 将理解与生成训练目标解耦,允许直接应用先进的 VQ tokenizer 而无需定制量化操作。我们的实验结果表明,TokLIP 实现了卓越的数据效率,赋予视觉 token 高层语义理解的同时增强低层生成能力,使其非常适合用于理解和生成任务中的自回归 Transformer。代码和模型可在 https://github.com/TencentARC/TokLIP 获取。
引用
@article{arxiv.2505.05422,
title = {TokLIP: Marry Visual Tokens to CLIP for Multimodal Comprehension and Generation},
author = {Haokun Lin and Teng Wang and Yixiao Ge and Yuying Ge and Zhichao Lu and Ying Wei and Qingfu Zhang and Zhenan Sun and Ying Shan},
journal= {arXiv preprint arXiv:2505.05422},
year = {2025}
}
备注
Technical Report