中文

Osprey: 基于视觉指令微调的像素级理解

计算机视觉与模式识别 2025-09-09 v4

摘要

多模态大语言模型 (MLLMs) 近期通过视觉指令微调获得了令人印象深刻的通用视觉语言能力。然而,当前的 MLLMs 主要侧重于图像级或框级理解,在实现像素级的细粒度视觉语言对齐方面尚有不足。此外,基于掩码的指令数据的缺乏限制了它们的进一步发展。在本文中,我们提出了一种掩码-文本指令微调方法 Osprey,通过将细粒度掩码区域引入语言指令来扩展 MLLMs,旨在实现像素级的视觉理解。为实现这一目标,我们首先精心整理了一个包含 724K 样本的基于掩码的区域-文本数据集,随后通过将像素级表征注入 LLM 来设计一个视觉语言模型。具体而言,Osprey 采用卷积 CLIP 主干作为视觉编码器,并利用掩码感知视觉提取器从高分辨率输入中提取精确的视觉掩码特征。实验结果证明了 Osprey 在各种区域理解任务中的优越性,展示了其在像素级指令微调方面的新能力。特别是,Osprey 可以与 Segment Anything Model (SAM) 无缝集成以获取多粒度语义。源代码、数据集和演示可在 https://github.com/CircleRadon/Osprey 获取。

关键词

引用

@article{arxiv.2312.10032,
  title  = {Osprey: Pixel Understanding with Visual Instruction Tuning},
  author = {Yuqian Yuan and Wentong Li and Jian Liu and Dongqi Tang and Xinjie Luo and Chi Qin and Lei Zhang and Jianke Zhu},
  journal= {arXiv preprint arXiv:2312.10032},
  year   = {2025}
}

备注

CVPR2024, Code and Demo link:https://github.com/CircleRadon/Osprey