中文

用 SEED 分词器让 LLaMA 看并画

计算机视觉与模式识别 2023-10-03 v1

摘要

大语言模型(LLMs)的巨大成功拓展了多模态的潜力,推动了通用人工智能(AGI)的逐步演进。一个真正的 AGI 智能体不仅应具备执行预定义多任务的能力,还应在开放世界语境中展现出涌现能力。然而,尽管近期多模态 LLM 取得了可观进展,它们仍未能有效统一理解与生成任务,更遑论开放世界涌现能力。我们认为,突破当前困境的关键在于使文本与图像能在统一的自回归 Transformer 中可互换地表示与处理。为此,我们引入 SEED,一种精巧的图像分词器,赋予 LLM 同时“看”与“画”的能力。我们确定了两个关键设计原则:(1)图像词元应独立于二维物理块位置,而应以一维因果依赖生成,展现出与 LLM 中从左至右自回归预测机制相对齐的内在相互依赖。(2)图像词元应捕获与词词语义抽象程度一致的高层语义,并在分词器训练阶段针对判别性与重建性进行优化。借助 SEED 词元,LLM 能在其原始训练方案(即下一词预测)下执行可扩展的多模态自回归。SEED-LLaMA 因此通过交错文本与视觉数据的大规模预训练与指令微调产生,在广泛的多模态理解与生成任务上展现出令人印象深刻的性能。更重要的是,SEED-LLaMA 已展现出如多轮上下文内多模态生成等组合式涌现能力,宛如您的 AI 助手。

关键词

引用

@article{arxiv.2310.01218,
  title  = {Making LLaMA SEE and Draw with SEED Tokenizer},
  author = {Yuying Ge and Sijie Zhao and Ziyun Zeng and Yixiao Ge and Chen Li and Xintao Wang and Ying Shan},
  journal= {arXiv preprint arXiv:2310.01218},
  year   = {2023}
}

备注

Project released at: https://github.com/AILab-CVC/SEED. arXiv admin note: substantial text overlap with arXiv:2307.08041