InternVL:扩展视觉基础模型并对齐通用视觉 - 语言任务
计算机视觉与模式识别
2024-01-18 v3
摘要
大型语言模型 (LLM) 的指数级增长为多模态 AGI 系统开辟了众多可能性。然而,作为多模态 AGI 关键要素的视觉及视觉 - 语言基础模型的进展尚未跟上 LLM 的步伐。在本文中,我们设计了一个大规模视觉 - 语言基础模型 (InternVL),将视觉基础模型扩展至 60 亿参数,并利用来自各种来源的网络规模图像 - 文本数据逐步将其与 LLM 对齐。该模型可广泛应用于 32 个通用视觉 - 语言基准测试并取得最先进 (SOTA) 性能,涵盖图像级或像素级识别等视觉感知任务、零样本图像/视频分类和零样本图像/视频 - 文本检索等视觉 - 语言任务,并能与 LLM 链接以构建多模态对话系统。它具有强大的视觉能力,可作为 ViT-22B 的良好替代方案。我们希望我们的研究能为多模态大模型的发展做出贡献。代码和模型可在 https://github.com/OpenGVLab/InternVL 获取。
引用
@article{arxiv.2312.14238,
title = {InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks},
author = {Zhe Chen and Jiannan Wu and Wenhai Wang and Weijie Su and Guo Chen and Sen Xing and Muyan Zhong and Qinglong Zhang and Xizhou Zhu and Lewei Lu and Bin Li and Ping Luo and Tong Lu and Yu Qiao and Jifeng Dai},
journal= {arXiv preprint arXiv:2312.14238},
year = {2024}
}
备注
25 pages, 5 figures, 28 tables