MetaMorph:通过指令微调实现多模态理解与生成
计算机视觉与模式识别
2024-12-19 v1
摘要
在这项工作中,我们提出了视觉预测指令微调 (VPiT)——一种对视觉指令微调的简单而有效的扩展,使预训练的 LLM 能够快速转变为一个能够生成文本和视觉 token 的统一自回归模型。VPiT 教导 LLM 从以指令跟随格式策划的图像和文本数据的任意输入序列中预测离散文本 token 和连续视觉 token。我们的实证研究揭示了 VPiT 的几个有趣特性:(1) 视觉生成能力作为视觉理解改进的自然副产品而出现,并且可以通过少量生成数据被高效解锁;(2) 尽管我们发现理解和生成是互利的,但理解数据对这两种能力的贡献比生成数据更有效。基于这些发现,我们训练了 MetaMorph 模型,并在视觉理解和生成方面均取得了有竞争力的性能。在视觉生成方面,MetaMorph 可以利用从 LLM 预训练中获得的世界知识和推理能力,并克服其他生成模型表现出的常见失败模式。我们的结果表明,LLM 可能具有强大的“先验”视觉能力,可以通过相对简单的指令微调过程高效地适应视觉理解和生成。
引用
@article{arxiv.2412.14164,
title = {MetaMorph: Multimodal Understanding and Generation via Instruction Tuning},
author = {Shengbang Tong and David Fan and Jiachen Zhu and Yunyang Xiong and Xinlei Chen and Koustuv Sinha and Michael Rabbat and Yann LeCun and Saining Xie and Zhuang Liu},
journal= {arXiv preprint arXiv:2412.14164},
year = {2024}
}
备注
Project page at tsb0601.github.io/metamorph