用于指代图像分割的空间语义循环挖掘
计算机视觉与模式识别
2024-05-16 v1 计算与语言
摘要
指代图像分割(RIS)始终需要语言和外观语义更好地相互理解。这种需求在困难情境下尤为迫切。为了实现这一点,现有工作倾向于采用各种跨表示机制,将语言语义直接前馈至主 RGB 分支,然而这会导致空间上的指代物分布挖掘不充分,以及通道上的非指代语义受到污染。在本文中,我们提出了空间语义循环挖掘(SRM)以实现高质量的跨模态融合。它遵循三部曲的工作策略:分发语言特征、空间语义循环协同解析以及解析语义平衡。在融合过程中,SRM 首先生成弱约束但分布感知的语言特征,然后将一种模态上下文旋转特征的每一行和每一列的特征进行捆绑,以循环关联另一种模态上下文特征中包含的相关语义,最后利用自蒸馏权重来衡量不同解析语义的贡献。通过协同解析,SRM 将信息从生成器上下文的近端和远端切片层传输到解析上下文的当前切片层,能够更好地进行双向和结构化的全局关系建模。此外,我们还提出了跨尺度抽象语义引导解码器(CASG)以强调指代物的前景,最终以相对较低的成本融合不同粒度的特征。在四个当前具有挑战性的数据集上的大量实验结果表明,我们提出的方法优于其他最先进的算法。
引用
@article{arxiv.2405.09006,
title = {Spatial Semantic Recurrent Mining for Referring Image Segmentation},
author = {Jiaxing Yang and Lihe Zhang and Jiayu Sun and Huchuan Lu},
journal= {arXiv preprint arXiv:2405.09006},
year = {2024}
}