通过纠正学习:面向零样本生成式视觉-语言推理的高效微调任务
计算机视觉与模式识别
2024-04-02 v1
摘要
生成式视觉-语言模型(VLM)在图像描述和视觉问答等零样本视觉-语言任务中展现出了令人瞩目的性能。然而,提升其零样本推理能力通常需要第二阶段的指令微调,这严重依赖人工标注或大语言模型生成的标注,产生高昂的标注成本。为应对这一挑战,我们引入了图像条件描述纠正(ICCC),这是一种新颖的预训练任务,旨在无需标注的任务感知数据即可增强 VLM 的零样本性能。ICCC 任务迫使 VLM 纠正视觉概念与语言概念之间的不匹配,从而增强指令遵循和基于视觉输入的文本生成。利用语言结构和轻量级依赖解析器,我们以低标注和计算成本从图像-文本数据集中构建了 ICCC 任务的数据样本。在 BLIP-2 和 InstructBLIP 上的实验结果表明,通过 ICCC 指令微调,在零样本图像-文本生成基础的视觉-语言任务中取得了显著提升。
引用
@article{arxiv.2404.00909,
title = {Learning by Correction: Efficient Tuning Task for Zero-Shot Generative Vision-Language Reasoning},
author = {Rongjie Li and Yu Wu and Xuming He},
journal= {arXiv preprint arXiv:2404.00909},
year = {2024}
}
备注
Accepted by CVPR2024