中文

Pixel-SAIL:用于像素级理解的单一 Transformer

计算机视觉与模式识别 2025-04-15 v1

摘要

多模态大语言模型(MLLM)在进行粒度像素级理解任务方面取得了显著的性能。但所有工作都高度依赖额外组件,如视觉编码器(CLIP)、分割专家,导致系统复杂度高,限制了模型规模。本文旨在探索不引入额外组件的高度简化 MLLM。我们的工作灵感来自最近的单一 trAnsformer 作为统一 vIsion-Language Model(SAIL)设计,这些工作在 Transformer 中联合学习视觉 token 和文本 token。我们提出了 Pixel-SAIL,用于像素级 MLLM任务的单一 Transformer。具体而言,我们对平凡基线进行了三个技术改进:首先,我们设计了一个可学习的上采样模块来细化视觉 token 特征;其次,我们提出了一种新颖的视觉提示注入策略,使单一 Transformer 能够理解视觉提示输入,并从早期融合视觉提示嵌入和视觉 token 中受益;最后,我们引入一种视觉专家蒸馏策略,有效提升单一 Transformer 的细粒度特征提取能力。此外,我们收集了一个全面的像素理解基准(PerBench),进行了手动检查,包括三个任务:详细物体描述、基于视觉提示的问答和视觉-文本指派分割。在四个指派分割基准、一个视觉提示基准和我们的 PerBench 上进行的大量实验表明,Pixel-SAIL 以更简洁的管道实现了与或甚至更好的结果。代码和模型将在 https://github.com/magic-research/Sa2VA 提供。

关键词

引用

@article{arxiv.2504.10465,
  title  = {Pixel-SAIL: Single Transformer For Pixel-Grounded Understanding},
  author = {Tao Zhang and Xiangtai Li and Zilong Huang and Yanwei Li and Weixian Lei and Xueqing Deng and Shihao Chen and Shunping Ji and Jiashi Feng},
  journal= {arXiv preprint arXiv:2504.10465},
  year   = {2025}
}