中文

PixelLM:基于大型多模态模型的像素级推理

计算机视觉与模式识别 2024-07-19 v3

摘要

尽管大型多模态模型在取得显著进展,但在涉及多个开放世界目标的图像推理任务中生成像素级掩码仍是一项挑战。为弥合这一差距,我们引入了 PixelLM,一种用于像素级推理与理解的高效 LMM。PixelLM 的核心是一个新颖的轻量级像素解码器与一个全面的分割码本。该解码器从码本 token 的隐藏嵌入中高效生成掩码,这些嵌入编码了详细的目标相关信息。凭借这一设计,PixelLM 与主流 LMM 的结构相协调,并避免了对额外昂贵分割模型的需求。此外,我们提出了一种目标细化损失以增强模型区分多个目标的能力,从而大幅提升掩码质量。为推进该领域的研究,我们构建了 MUSE,一个高质量的多目标推理分割基准。PixelLM 在各种像素级图像推理与理解任务中表现优异,在包括 MUSE、单目标与多目标指代分割在内的多个基准中超越了成熟的方法。全面的消融实验证实了所提各组件的有效性。所有代码、模型与数据集将公开发布。

关键词

引用

@article{arxiv.2312.02228,
  title  = {PixelLM: Pixel Reasoning with Large Multimodal Model},
  author = {Zhongwei Ren and Zhicheng Huang and Yunchao Wei and Yao Zhao and Dongmei Fu and Jiashi Feng and Xiaojie Jin},
  journal= {arXiv preprint arXiv:2312.02228},
  year   = {2024}
}

备注

(Accepted by CVPR 2024) Code and models are released at: https://pixellm.github.io/