IteRPrimE:基于迭代Grad-CAM细化和主导词强调的零样图象指涉分割
计算机视觉与模式识别
2025-03-04 v1
摘要
零样图象指涉分割(RIS)通过指定的指涉表达式识别最符合的实例掩码,而无需训练和微调,显著减少了耗时的标注过程。尽管取得了令人满意的结果,但以往的CLIP-based模型存在一个关键缺点:模型在辨识对象相对空间关系方面能力显著下降。这是因为它们会生成图像中所有可能的掩码,并评估每个掩码区域与给定表达式的相似度,往往导致对文本输入中直接位置线索的敏感性降低。此外,大多数方法对主导词与其上下文之间的关系处理能力较弱,导致混淆并降低准确识别正确目标区域的能力。为此,我们提出了IteRPrimE(Iterative Grad-CAM Refinement and Primary Word Emphasis),该方法通过Grad-CAM从视觉语言预训练(VLP)模型中生成显著性热图,用于图像-文本匹配。引入迭代Grad-CAM细化策略,以逐步增强模型对目标区域的关注,克服位置敏感性,产生自纠正效果。此外,我们设计了主导词强调模块,以帮助模型处理复杂的语义关系,增强其对意图对象的注意力。大量实验在RefCOCO/+/g和PhraseCut基准数据集上进行,表明IteRPrimE在各类零样方法中均优于前沿方法,尤其在跨域场景中表现尤为出色。
引用
@article{arxiv.2503.00936,
title = {IteRPrimE: Zero-shot Referring Image Segmentation with Iterative Grad-CAM Refinement and Primary Word Emphasis},
author = {Yuji Wang and Jingchen Ni and Yong Liu and Chun Yuan and Yansong Tang},
journal= {arXiv preprint arXiv:2503.00936},
year = {2025}
}
备注
AAAI 2025