中文

Segment Anyword: 用于开集接地分割的掩码提示反转

计算机视觉与模式识别 2025-05-26 v1

摘要

开集图像分割是一项重大挑战,因为现有方法通常需要大量训练或微调,并且通常难以在不同的文本参考表达式中一致地分割统一对象。基于此,我们提出Segment Anyword,一种新颖的无训练视觉概念提示学习方法,用于开集语言接地分割,该方法依赖于冻结扩散模型中的逐标记交叉注意力图来产生分割代理或掩码提示,然后将其细化为目标对象掩码。初始提示通常缺乏连贯性和一致性,因为图像-文本复杂度的增加,导致次优的掩码片段。为解决此问题,我们进一步引入了一种新颖的语言引导视觉提示正则化,根据句子依赖性和句法结构信息绑定和聚类视觉提示,从而实现鲁棒的、抗噪声的掩码提示提取,并在分割精度上取得显著提升。所提出的方法有效,且在不同开集分割任务上具有泛化能力,在Pascal Context 59上取得了52.5(+6.8相对)mIoU的最先进结果,在gRefCOCO上取得了67.73(+25.73相对)cIoU,在GranDf上取得了67.4(+1.1相对微调方法)mIoU,GranDf是该领域最复杂的开集接地分割任务。

关键词

引用

@article{arxiv.2505.17994,
  title  = {Segment Anyword: Mask Prompt Inversion for Open-Set Grounded Segmentation},
  author = {Zhihua Liu and Amrutha Saseendran and Lei Tong and Xilin He and Fariba Yousefi and Nikolay Burlutskiy and Dino Oglic and Tom Diethe and Philip Teare and Huiyu Zhou and Chen Jin},
  journal= {arXiv preprint arXiv:2505.17994},
  year   = {2025}
}