对比视觉-语言对齐造就高效指令学习器
计算机视觉与模式识别
2023-12-01 v1
摘要
我们研究将大语言模型(LLM)扩展为视觉-语言指令跟随模型的任务。该任务至关重要但充满挑战,因为LLM仅在文本模态上训练,难以有效消化视觉模态。为此,现有方法通常训练一个视觉适配器,通过生成式图像描述损失将预训练视觉Transformer(ViT)与LLM之间的表示对齐。然而,我们发现生成式目标只能产生弱的视觉与语言对齐,使得对齐后的视觉-语言模型极度依赖指令微调数据。本文中,我们提出CG-VLM,它同时采用对比和生成对齐目标来有效对齐ViT与LLM的表示。不同于常见对比学习设置中的图像级和句子级对齐,CG-VLM对齐图像块级特征与文本词元级嵌入,但这很难实现,因为标准图像描述数据集中没有提供显式的块-词元对应关系。为解决此问题,我们提出最大化池化后的图像块特征与文本词元嵌入之间的平均相似度。大量实验表明,所提出的CG-VLM产生了强视觉-语言对齐,是一个高效的指令学习器。例如,仅使用10%的指令微调数据,我们就在零样本ScienceQA-Image基准上达到了最先进方法LLaVA[29]的95%性能。
引用
@article{arxiv.2311.17945,
title = {Contrastive Vision-Language Alignment Makes Efficient Instruction Learner},
author = {Lizhao Liu and Xinyu Sun and Tianhang Xiang and Zhuangwei Zhuang and Liuren Yin and Mingkui Tan},
journal= {arXiv preprint arXiv:2311.17945},
year = {2023}
}
备注
17 pages, 10 pages for main paper, 7 pages for supplementary