CoLLaVO: 蜡笔大语言与视觉模型
计算机视觉与模式识别
2024-06-04 v4
摘要
大语言模型(LLMs)和指令微调的巨大成功推动着视觉语言模型(VLMs)向通用的多功能模型演进。然而,当前VLMs是否真正具备由“图像中有什么物体?”或“哪个物体对应于指定的边界框?”所决定的高质量物体级图像理解能力,仍有待探索。我们的发现表明,当前VLMs的图像理解能力与其在视觉语言(VL)任务上的零样本性能密切相关。这表明,优先考虑基本的图像理解对于VLMs在VL任务中表现出色至关重要。为了增强物体级图像理解,我们提出了蜡笔大语言与视觉模型(CoLLaVO),该模型将指令微调与基于全景彩色地图的新型视觉提示微调方案——蜡笔提示(Crayon Prompt)相结合。此外,我们提出了一种双QLoRA学习策略,以在视觉指令微调过程中保留物体级图像理解能力而不遗忘,从而在零样本设置下在众多VL基准测试中实现了显著的飞跃。
引用
@article{arxiv.2402.11248,
title = {CoLLaVO: Crayon Large Language and Vision mOdel},
author = {Byung-Kwan Lee and Beomchan Park and Chae Won Kim and Yong Man Ro},
journal= {arXiv preprint arXiv:2402.11248},
year = {2024}
}
备注
ACL 2024 Findings. Code available: https://github.com/ByungKwanLee/CoLLaVO