VisCon-100K:利用上下文 Web 数据进行视觉语言模型的精调
计算与语言
2025-02-25 v2 计算机视觉与模式识别
摘要
视觉语言模型(VLM)在 various visual benchmarks 中表现出色,但常受限于缺乏高质量的视觉微调数据。为解决这一挑战,我们引入 VisCon-100K,这是一个源自交错图像-文本网页文档的新型数据集。我们的方法将来自 OBELICS 数据集中的 45000 份网页文档转换为 100000 份图像对话样本。我们利用 GPT-4V 生成图像上下文描述,并使用 OpenChat 3.5 模型将这些描述转换为多样化的自由形式和多选问答对。将该数据集用于精调显著提升了 VLM 在多个基准测试中的性能。不同于仅聚焦细粒度视觉内容的方法,我们利用伴随的网页上下文,实现了卓越的效果。我们还发现,一种“泄漏性模态混合”,即对话样本包含可从图像及其上下文描述中回答的问题的问答对,优于非泄漏组合的描述和问答对。VisCon-100K 数据集在两种流行的 VLM 方法中表现突出:一种是文本-only 大型语言模型(LLM)通过图像描述数据与视觉编码器对齐(ShareGPT4V-7b),另一种是多模态预训练 LLM(IDEFICS2-8b)使用交错图像-文本数据。除了发布 VisCon-100K 数据集外,我们还提供了一个在该数据集上训练的上下文描述器,促进未来研究和开源应用的可扩展精调数据生成。我们也提供了使用相同管道但将训练好的上下文描述器替换 GPT-4V 的更大规模 VisCon-1M 数据集。
引用
@article{arxiv.2502.10250,
title = {VisCon-100K: Leveraging Contextual Web Data for Fine-tuning Vision Language Models},
author = {Gokul Karthik Kumar and Iheb Chaabane and Kebin Wu},
journal= {arXiv preprint arXiv:2502.10250},
year = {2025}
}
备注
Accepted at PAKDD 2025