InstructBLIP:面向通用视觉-语言模型的指令微调
计算机视觉与模式识别
2023-06-16 v2 机器学习
摘要
大规模预训练与指令微调已成功创建出具有广泛能力的通用语言模型。然而,由于额外视觉输入带来的丰富输入分布与任务多样性,构建通用视觉-语言模型颇具挑战。尽管视觉-语言预训练已被广泛研究,视觉-语言指令微调仍待探索。本文中,我们基于预训练的 BLIP-2 模型对视觉-语言指令微调进行了系统而全面的研究。我们收集了 26 个公开可用数据集,涵盖广泛任务与能力,并将其转化为指令微调格式。此外,我们引入了指令感知的 Query Transformer,可提取契合给定指令的信息化特征。在 13 个 held-in 数据集上训练后,InstructBLIP 在所有 13 个 held-out 数据集上取得了最先进的零样本性能,大幅优于 BLIP-2 与更大的 Flamingo 模型。我们的模型在下游独立任务微调时也达到最先进性能(例如带图像上下文的 ScienceQA 问题准确率达 90.7%)。此外,我们定性展示了 InstructBLIP 相对于同期多模态模型的优势。所有 InstructBLIP 模型已于 https://github.com/salesforce/LAVIS/tree/main/projects/instructblip 开源。
引用
@article{arxiv.2305.06500,
title = {InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning},
author = {Wenliang Dai and Junnan Li and Dongxu Li and Anthony Meng Huat Tiong and Junqi Zhao and Weisheng Wang and Boyang Li and Pascale Fung and Steven Hoi},
journal= {arXiv preprint arXiv:2305.06500},
year = {2023}
}
备注
preprint