PARTONOMY:具备粒度视觉理解能力的大型多模态模型
摘要
现实世界中的物体由独特且特定于物体的组成部分构成。识别这些部分对于执行细粒度、组合推理至关重要——但大型多模态模型(LMM)在这一看似直接的任务中表现不佳。本文引入 PARTONOMY,一个用于像素级零件 grounding 的 LMM 基准数据集。我们从现有零件数据集以及自建的严格标注图像集构建了 PARTONOMY,涵盖 862 个零件标签和 534 个物体标签用于评估。不同于现有数据集仅询问模型识别通用零件的方法,PARTONOMY 使用专门概念(如农业飞机),并挑战模型比较物体的零件、考虑零件-整体关系,并用视觉分段来论证文本预测。我们的实验表明,主流 LMM(如 LISA-13B 仅能实现 5.9% 的 gIoU),凸显了其在零件 grounding 能力的严重不足。我们指出,现有的分段型 LMM 在两个关键架构缺陷:它们使用的特殊 [SEG] token 在预训练期间未出现,导致分布迁移;它们丢弃预测的分段结果,而不利用过去的预测指导未来的预测。为解决这些问题,我们训练了多个以零件为中心的 LMM,并提出了 PLUM,这是一种新颖的分段型 LMM,使用 span tagging 代替分段 token,并在反馈循环中对先前预测进行条件化。我们发现,预训练的 PLUM 在推理分段、VQA 和视觉幻觉基准测试中超越了现有的分段型 LMM。此外,PLUM 在我们提出的解释性零件分段任务上微调后,在分段数据显著多于的其他分段型 LMM 上也表现出竞争力。我们的工作开启了新的研究方向,以实现 LMM 中的细粒度、扎根的视觉理解。
引用
@article{arxiv.2505.20759,
title = {PARTONOMY: Large Multimodal Models with Part-Level Visual Understanding},
author = {Ansel Blume and Jeonghwan Kim and Hyeonjeong Ha and Elen Chatikyan and Xiaomeng Jin and Khanh Duy Nguyen and Nanyun Peng and Kai-Wei Chang and Derek Hoiem and Heng Ji},
journal= {arXiv preprint arXiv:2505.20759},
year = {2025}
}
备注
NeurIPS 2025 Spotlight; project page: https://wjdghks950.github.io/partonomy.github.io/