中文

Monkey:图像分辨率与文本标签是大中型多模态模型的重要要素

计算机视觉与模式识别 2024-08-27 v4 人工智能 计算与语言

摘要

大型多模态模型(LMMs)在视觉-语言任务中展现出潜力,但在高分辨率输入与细粒度场景理解方面存在困难。为应对这些挑战,我们引入 Monkey 以增强 LMM 能力。首先,Monkey 将输入图像划分为均匀块,每块尺寸(如 448×448)与预训练视觉编码器原始训练所用尺寸一致。借助为每个块配备的独立适配器,Monkey 可处理高达 1344×896 像素的更高分辨率,从而能够细致捕捉复杂视觉信息。其次,它采用多级描述生成方法,丰富场景-物体关联的上下文。这一双重策略确保了从生成数据中更有效地学习:更高的分辨率允许更细致地捕捉视觉内容,进而提升综合描述的有效性。大量消融结果验证了我们的设计有效性。此外,在 18 个数据集上的实验进一步表明,Monkey 在图像描述与多种视觉问答格式等许多任务上超越了现有 LMMs。特别是在聚焦于密集文本问答的定性测试中,Monkey 相比 GPT4V 展现出令人鼓舞的结果。代码见 https://github.com/Yuliang-Liu/Monkey。

关键词

引用

@article{arxiv.2311.06607,
  title  = {Monkey: Image Resolution and Text Label Are Important Things for Large Multi-modal Models},
  author = {Zhang Li and Biao Yang and Qiang Liu and Zhiyin Ma and Shuo Zhang and Jingxu Yang and Yabo Sun and Yuliang Liu and Xiang Bai},
  journal= {arXiv preprint arXiv:2311.06607},
  year   = {2024}
}

备注

CVPR 2024 Highlight