微调多模态 LLM 以遵循零样本示范性指令
计算机视觉与模式识别
2024-05-28 v4
摘要
多模态大语言模型(MLLM)近期进展利用视觉提示生成器(VPG)将视觉特征转换为 LLM 可识别的 token。这是通过在数百万图像- caption 对上训练 VPG 实现的,其中图像由 VPG 生成的 token 被输入冻结的 LLM 以生成相应 caption。然而,这种基于图像描述训练的目标本征地使 VPG 偏重于仅关注足以生成 caption 的主要视觉内容,常忽略其它视觉细节。这一缺陷导致 MLLM 在理解由多个交错多模态指令组成、展示完成任务所需上下文的示范性指令时表现不佳。为解决此问题,我们引入一个通用且轻量的视觉提示生成器补全模块(VPG-C),其可推断并补全理解示范性指令所需的关键缺失细节。进一步,我们提出一种合成判别训练策略来微调 VPG-C,免去对监督示范性指令的需求。在评估方面,我们构建了 DEMON,一个用于示范性指令理解的综合性基准。采用所提策略进行合成训练的 VPG-C 在 DEMON 所有任务上取得了显著更强的零样本性能。在 MME 和 OwlEval 基准上的进一步评估也证明了 VPG-C 的优越性。我们的基准、代码和预训练模型可在 https://github.com/DCDmllm/Cheetah 获取。
引用
@article{arxiv.2308.04152,
title = {Fine-tuning Multimodal LLMs to Follow Zero-shot Demonstrative Instructions},
author = {Juncheng Li and Kaihang Pan and Zhiqi Ge and Minghe Gao and Wei Ji and Wenqiao Zhang and Tat-Seng Chua and Siliang Tang and Hanwang Zhang and Yueting Zhuang},
journal= {arXiv preprint arXiv:2308.04152},
year = {2024}
}
备注
Accepted by ICLR 2024 (Spotlight)