中文

问:如何将大型视觉-语言模型专用于数据稀缺的 VQA 任务?答:在未标注图像上自训练!

计算机视觉与模式识别 2023-06-08 v1

摘要

在大规模预训练之后于目标数据集上微调大型视觉语言模型(VLM)是视觉问答(VQA)中的主导范式。用于知识型 VQA 或非自然图像域 VQA 等专门任务的数据集比通用 VQA 的数据集小几个数量级。虽然为专门任务或领域收集额外标注可能具有挑战性,但未标注图像通常可得。我们引入 SelTDA(Self-Taught Data Augmentation,自教数据增强),一种在小型 VQA 数据集上微调大型 VLM 的策略。SelTDA 利用 VLM 和目标数据集构建教师模型,该模型可直接以图像为条件生成问答伪标签,从而让我们对未标注图像打伪标签。SelTDA 随后在原始数据集扩充以新伪标签图像的基础上微调初始 VLM。我们描述了一系列实验,表明我们的自教数据增强提升了对对抗搜索问题、反事实样本和改述的鲁棒性,改善了域泛化,并带来数值推理技能的更好保持。所提策略不需要额外标注或架构修改,且兼容任何现代编码器-解码器多模态 transformer。代码见 https://github.com/codezakh/SelTDA。

关键词

引用

@article{arxiv.2306.03932,
  title  = {Q: How to Specialize Large Vision-Language Models to Data-Scarce VQA Tasks? A: Self-Train on Unlabeled Images!},
  author = {Zaid Khan and Vijay Kumar BG and Samuel Schulter and Xiang Yu and Yun Fu and Manmohan Chandraker},
  journal= {arXiv preprint arXiv:2306.03932},
  year   = {2023}
}

备注

CVPR 2023