中文

用于开放词汇部件分割的细粒度图文对应与代价聚合

计算机视觉与模式识别 2025-08-11 v2

摘要

Open-Vocabulary Part Segmentation (OVPS) 是一个新兴领域,旨在识别未见类别中的细粒度部件。我们指出了 OVPS 中的两个主要挑战:(1) 部件级图文对应对齐的困难,以及 (2) 分割对象部件时结构理解的缺乏。为了解决这些问题,我们提出了 PartCATSeg,这是一个融合了对象感知部件级代价聚合、组合损失以及来自 DINO 的结构指导的新颖框架。我们的方法采用了解耦的代价聚合策略,分别处理对象级和部件级代价,从而提升了部件级分割的精度。我们还引入了组合损失以更好地捕捉部件-对象关系,弥补了部件标注的不足。此外,来自 DINO 特征的结构指导改进了边界描绘和部件间的理解。在 Pascal-Part-116、ADE20K-Part-234 和 PartImageNet 数据集上的大量实验表明,我们的方法显著优于 state-of-the-art 方法,为对未见部件类别的稳健泛化设定了新的基准。

关键词

引用

@article{arxiv.2501.09688,
  title  = {Fine-Grained Image-Text Correspondence with Cost Aggregation for Open-Vocabulary Part Segmentation},
  author = {Jiho Choi and Seonho Lee and Minhyun Lee and Seungho Lee and Hyunjung Shim},
  journal= {arXiv preprint arXiv:2501.09688},
  year   = {2025}
}

备注

CVPR 2025