中文

ShareGPT4V:以更优图像描述提升大型多模态模型

计算机视觉与模式识别 2023-11-29 v2

摘要

在大型多模态模型(LMMs)领域,高效的模态对齐至关重要,却常受限于高质量图文数据的匮乏。为突破这一瓶颈,我们推出了 ShareGPT4V 数据集,这是一个开创性的大规模资源,包含 120 万条极具描述性的图像描述,在多样性和信息量上超越现有数据集,涵盖世界知识、物体属性、空间关系与美学评价。具体而言,ShareGPT4V 源自从先进 GPT4-Vision 收集的 10 万条精选高质量描述,并基于在该子集上训练出的卓越描述模型扩展至 120 万条。ShareGPT4V 首先证明了其在监督微调(SFT)阶段的有效性:用我们高质量描述的一个子集替换现有 SFT 数据集中等量的详细描述,可显著提升 LLaVA-7B、LLaVA-1.5-13B 和 Qwen-VL-Chat-7B 等 LMMs 在 MME 与 MMBench 基准上的表现,增益分别为 222.8/22.0/22.3 与 2.7/1.3/1.5。我们进一步将 ShareGPT4V 数据引入预训练与 SFT 阶段,得到 ShareGPT4V-7B——一个基于简洁架构的优越 LMM,在绝大多数多模态基准上表现突出。本项目发布于 https://ShareGPT4V.github.io,以作为推动 LMMs 社区发展的关键资源。

关键词

引用

@article{arxiv.2311.12793,
  title  = {ShareGPT4V: Improving Large Multi-Modal Models with Better Captions},
  author = {Lin Chen and Jinsong Li and Xiaoyi Dong and Pan Zhang and Conghui He and Jiaqi Wang and Feng Zhao and Dahua Lin},
  journal= {arXiv preprint arXiv:2311.12793},
  year   = {2023}
}

备注

Project: https://ShareGPT4V.github.io