在大语言模型中播下视觉之种(SEED)
计算机视觉与模式识别
2023-08-15 v2
摘要
我们提出 SEED,一种精细设计的图像 tokenizer,赋予大语言模型(LLMs)同时看见与绘制的涌现能力。此前关于图像 tokenizer 的研究已陷入僵局,因为采用量化视觉 token 的框架由于在多模态理解(相较 BLIP-2 等)或生成(相较 Stable Diffusion 等)上的不佳表现与收敛性而失去关注。尽管存在局限,我们仍对其统一视觉与文本表示、以 LLM 原有方案实现可扩展多模态训练的自然能力保持信心。本研究中,我们确定了 SEED 架构与训练的两项关键原则,可有效缓解后续与 LLM 的对齐。(1)图像 token 应独立于 2D 物理块位置,而应以 1D 因果依赖生成,展现与 LLM 中从左至右自回归预测机制一致的内在相互依赖。(2)图像 token 应捕获与词中语义抽象程度一致的高层语义,并在 tokenizer 训练阶段针对判别性与重建性进行优化。因此,现成的 LLM 能够通过高效 LoRA 微调整合我们的 SEED 来执行图像到文本与文本到图像生成。全面的多模态预训练与指令微调(可能带来更优结果)留待未来研究。此版 SEED 仅使用 64 块 V100 GPU 与 500 万公开图像-文本对,在 5.7 天内完成训练。我们的初步研究强调了离散视觉 token 在多用途多模态 LLM 中的巨大潜力,以及恰当图像 tokenizer 在更广义研究中的重要性。
引用
@article{arxiv.2307.08041,
title = {Planting a SEED of Vision in Large Language Model},
author = {Yuying Ge and Yixiao Ge and Ziyun Zeng and Xintao Wang and Ying Shan},
journal= {arXiv preprint arXiv:2307.08041},
year = {2023}
}
备注
Technical Report; Project released at: https://github.com/AILab-CVC/SEED