中文

Vision-Flan:扩展视觉指令微调中的人工标注任务

计算与语言 2024-02-20 v1 计算机视觉与模式识别

摘要

尽管视觉语言模型(VLMs)作为多功能视觉助手展现出非凡的能力,但现有 VLM 框架中仍存在两个重大挑战:(1) 预训练和视觉指令微调中缺乏任务多样性,以及 (2) GPT-4 合成的指令微调数据中存在标注错误和偏差。这两个挑战导致了泛化性差、幻觉和灾难性遗忘等问题。为应对这些挑战,我们构建了 Vision-Flan,这是迄今为止最多样化的公开可用视觉指令微调数据集,包含源自学术数据集的 187 种多样化任务和 1,664,261 个实例,且每个任务都配有专家编写的指令。此外,我们提出了一种两阶段指令微调框架,其中 VLMs 首先在 Vision-Flan 上进行微调,然后在 GPT-4 合成数据上进一步微调。我们发现,这种两阶段微调框架显著优于传统的单阶段视觉指令微调框架,并在广泛的多模态评估基准测试中实现了最先进(SOTA)的性能。最后,我们进行了深入分析以理解视觉指令微调,我们的发现揭示:(1) GPT-4 合成数据并未显著增强 VLMs 的能力,而是调节模型响应以符合人类偏好的格式;(2) 极少量(例如 1,000 条)的 GPT-4 合成数据即可有效地将 VLM 响应与人类偏好对齐;(3) 视觉指令微调主要帮助大型语言模型(LLMs)理解视觉特征。

关键词

引用

@article{arxiv.2402.11690,
  title  = {Vision-Flan: Scaling Human-Labeled Tasks in Visual Instruction Tuning},
  author = {Zhiyang Xu and Chao Feng and Rulin Shao and Trevor Ashby and Ying Shen and Di Jin and Yu Cheng and Qifan Wang and Lifu Huang},
  journal= {arXiv preprint arXiv:2402.11690},
  year   = {2024}
}

备注

8 Pages, visual instruction tuning