通过自训练提升大型视觉语言模型在图像理解方面的性能
计算机视觉与模式识别
2024-11-26 v2 计算与语言
摘要
大型视觉语言模型(LVLMs)将大型语言模型(LLMs)与预训练视觉编码器集成,从而激发模型对图像输入的感知能力,以理解不同查询下的图像并进行后续推理。提升这一能力需要高质量的视觉语言数据,而获取此类数据成本高昂且耗时。自训练方法在单模态设置中有效地通过利用模型自身生成的内容来缓解标签数据需求的压力。然而,鉴于LVLMs独特的视觉感知与推理能力,有效的自训练仍是一个挑战。为此,我们提出了面向图像理解的自训练方法(Self-Training on Image Comprehension, STIC),强调一种专为图像理解设计的自训练方法。首先,模型利用无标签图像自构建图像描述的偏好数据集。通过逐步提示生成偏好响应,而从损坏图像或误导性提示中生成不偏好响应。为进一步自我提升提取视觉信息上的推理能力,我们让模型重复利用一小部分现有的指令微调数据,并将自生成的图像描述附加到提示中。我们在七个不同的基准测试上验证了STIC的有效性,显示在使用当前方法时仅需70%的监督微调数据,即可实现平均4.0%的显著性能提升。进一步的研究探讨了STIC的各个组件,凸显了其利用大量无标签图像进行自训练的潜力。代码和数据已公开提供。
引用
@article{arxiv.2405.19716,
title = {Enhancing Large Vision Language Models with Self-Training on Image Comprehension},
author = {Yihe Deng and Pan Lu and Fan Yin and Ziniu Hu and Sheng Shen and Quanquan Gu and James Zou and Kai-Wei Chang and Wei Wang},
journal= {arXiv preprint arXiv:2405.19716},
year = {2024}
}
备注
22 pages, 14 figures, 9 tables