中文

VPGTrans:跨 LLM 迁移视觉提示生成器

计算机视觉与模式识别 2023-10-25 v2 人工智能 计算与语言

摘要

虽然通过从头预训练海量图像-文本对来开发新的多模态 LLM(MLLM)可能极其消耗资源,但将现有 LLM 与相对轻量的视觉提示生成器(VPG)相连接成为一种可行范式。然而,进一步微调 MLLM 的 VPG 部分仍不可避免地面临计算成本,即需要数千 GPU 小时和数百万训练数据。一种替代方案是从任何现有 MLLM 向目标 MLLM 迁移已有的 VPG。在本工作中,我们首次研究了跨 LLM 的 VPG 可迁移性,并探索了一种降低 VPG 迁移成本的方案。我们首先研究了跨不同 LLM 规模(例如小到大)以及跨不同 LLM 类型的 VPG 迁移,借此诊断最大化迁移效率的关键因素。基于我们的观察,我们设计了一个名为 VPGTrans 的两阶段迁移框架,该框架简单但极为有效。通过广泛实验,我们证明 VPGTrans 能显著加速迁移学习过程且不损害性能。值得注意的是,它实现了从 BLIP-2 OPT2.7B_\text{2.7B} 到 BLIP-2 OPT6.7B_\text{6.7B} 的 VPG 迁移,相比从零将 VPG 连接到 OPT6.7B_\text{6.7B},速度提升超过 10 倍且仅需 10.7% 的训练数据。此外,我们提供并讨论了一系列有趣发现及其背后的潜在原理。最后,我们通过使用近期发布的 LLaMA 和 Vicuna LLM 定制两个新颖的 MLLM(包括 VL-LLaMA 和 VL-Vicuna)展示了 VPGTrans 方法的实用价值。

关键词

引用

@article{arxiv.2305.01278,
  title  = {VPGTrans: Transfer Visual Prompt Generator across LLMs},
  author = {Ao Zhang and Hao Fei and Yuan Yao and Wei Ji and Li Li and Zhiyuan Liu and Tat-Seng Chua},
  journal= {arXiv preprint arXiv:2305.01278},
  year   = {2023}
}

备注

Project Website: https://vpgtrans.github.io Code: https://github.com/VPGTrans/VPGTrans NeurIPS 2023