面向零样本指代图像分割的混合全局-局部表示与增强空间引导
计算机视觉与模式识别
2025-04-02 v1 人工智能
摘要
近期,由 Segment Anything Model (SAM) 和 CLIP 等模型推动的零样本指代图像分割 (RIS) 取得了显著进展,使视觉与文本信息的对齐取得了实质性进展。尽管如此,提取精确且高质量掩码区域表示的任务仍然是一个关键挑战,限制了 RIS 任务的潜力。本文引入一种训练-free 的混合全局-局部特征提取方法,将详细的掩码特定特征与周围区域的上下文信息相结合,以增强掩码区域的表示。为进一步加强掩码区域与指代表达式之间的对齐,我们提出了一种空间引导数据增强策略,通过引入多个空间线索,提高了空间一致性,这对于准确局部化描述区域至关重要。该方法实现了更稳健和精确的指代分割。在标准 RIS 基准测试上的大量实验表明,我们的方法显著优于现有的零样本 RIS 模型,实现了显著的性能提升。我们认为我们的做法推动了 RIS 任务的发展,建立了一个灵活的区域-文本对齐框架,为跨模态理解和交互提供了更广泛的意义。代码可在 https://github.com/fhgyuanshen/HybridGL 上获取。
引用
@article{arxiv.2504.00356,
title = {Hybrid Global-Local Representation with Augmented Spatial Guidance for Zero-Shot Referring Image Segmentation},
author = {Ting Liu and Siyuan Li},
journal= {arXiv preprint arXiv:2504.00356},
year = {2025}
}
备注
accepted to CVPR2025