中文

CALICO:基于大型视觉语言模型的面向部件的语义共分割

计算机视觉与模式识别 2025-04-07 v2 人工智能 机器学习

摘要

近期大型视觉语言模型(Large Vision-Language Models, LVLMs)的进展使通过视觉指令调谐实现通用视觉任务成为可能。虽然现有的LVLMs能够从文本提示为单个图像生成分割掩码,但在跨图像的分割驱动推理中尤其是在对象部件等更细粒度层次方面仍面临挑战。本文提出一种新的任务,即部件聚焦语义共分割,涉及识别和分割跨图像中常见对象以及常见和唯一对象部件。为解决这一任务,我们提出了CALICO,是首个为多图像部件级推理分割设计的LVMM。CALICO包含两个关键组件:一种新颖的对应提取模块,用于识别语义部件级对应关系,以及对应适应模块,将此信息嵌入LVMM以便以参数高效方式促进跨图像理解。为支持训练和评估,我们策划了MixedParts,一个包含约240万个样本、涵盖约44000张图像的大型多图像分割数据集,涵盖多样化的对象和部件类别。实验结果表明,CALICO仅需微调0.3%的参数即可在这一具有挑战性的任务上取得优异性能。

关键词

引用

@article{arxiv.2412.19331,
  title  = {CALICO: Part-Focused Semantic Co-Segmentation with Large Vision-Language Models},
  author = {Kiet A. Nguyen and Adheesh Juvekar and Tianjiao Yu and Muntasir Wahed and Ismini Lourentzou},
  journal= {arXiv preprint arXiv:2412.19331},
  year   = {2025}
}

备注

Accepted to CVPR 2025. Project page: https://plan-lab.github.io/calico/