眼见为实:提示 GPT-4V 以获得更好的视觉指令微调
计算机视觉与模式识别
2023-11-30 v2
摘要
现有的视觉指令微调方法通常用文本描述提示大语言模型以生成指令跟随数据。尽管取得了可喜的性能,这些描述源自图像标注,往往较为粗粒度。此外,在不观察完整视觉上下文的情况下,指令甚至可能违背视觉内容。为应对这一挑战,我们引入一个细粒度视觉指令数据集 LVIS-Instruct4V,包含 220K 条视觉对齐且上下文感知的指令,由强大的 GPT-4V 基于 LVIS 中的图像提示生成。通过实验验证与案例研究,我们证明高质量视觉指令数据能显著提升最先进的大多模态模型 LLaVA-1.5 在广泛基准上的性能,且优势明显。值得注意的是,仅用我们的 LVIS-Instruct4V 替换 LLaVA-Instruct,我们在大多数具挑战性的 LMM 基准上取得了优于 LLaVA 的结果,例如 LLaVA(76.7 对比 70.7)和 MM-Vet(40.2 对比 35.4)。我们在 https://github.com/X2FD/LVIS-INSTRUCT4V 发布数据和模型。
引用
@article{arxiv.2311.07574,
title = {To See is to Believe: Prompting GPT-4V for Better Visual Instruction Tuning},
author = {Junke Wang and Lingchen Meng and Zejia Weng and Bo He and Zuxuan Wu and Yu-Gang Jiang},
journal= {arXiv preprint arXiv:2311.07574},
year = {2023}
}
备注
techical report; work in progress