SaFiRe:基于 Mamba 的 Saccade-Fixation 重复用于指涉图像分割
计算机视觉与模式识别
2025-11-27 v2 人工智能
摘要
指涉图像分割(RIS)旨在给定自然语言表达式对图像中的目标对象进行分割。虽然最近的方法利用预训练的视觉主干网络和更多的训练语料库取得了令人印象的成果,但它们主要聚焦于简单表达式——诸如“红色汽车”或“左边的女孩”等简短、清晰的名词短语。这一简化常常将 RIS 简化为关键词/概念匹配问题,限制了模型处理指涉歧义表达式的能力。在本工作中,我们识别出两种具有挑战性的真实场景:对象干扰表达式(涉及多个带有语境线索的实体)和类别隐式表达式(目标类别未明确说明)。为应对这些挑战,我们提出了一种新框架 SaFiRe,其模拟了人类两种认知过程:首先形成全局理解,然后通过细节导向的检查进行细化。这在 Mamba 的扫描-更新属性中自然得到支持,这与我们的分阶段设计相吻合,并实现线性复杂度的高效多周期细化。我们进一步引入 aRefCOCO 作为新的基准,用于评估在含歧义指涉表达式下的 RIS 模型。大量实验在标准数据集和所提数据集上均表明 SaFiRe 在 SOTA 基线之上。
引用
@article{arxiv.2510.10160,
title = {SaFiRe: Saccade-Fixation Reiteration with Mamba for Referring Image Segmentation},
author = {Zhenjie Mao and Yuhuan Yang and Chaofan Ma and Dongsheng Jiang and Jiangchao Yao and Ya Zhang and Yanfeng Wang},
journal= {arXiv preprint arXiv:2510.10160},
year = {2025}
}
备注
NeurIPS 2025; Project page: https://zhenjiemao.github.io/SaFiRe/