中文

一种基于单编码器的简单基线用于指涉图像分割

计算机视觉与模式识别 2025-06-18 v3 多媒体

摘要

指涉图像分割(RIS)需要在视觉像素和文本单词之间进行稠密的视觉-语言交互,以基于给定描述对对象进行分割。然而,常用的双编码器在RIS中应用(如Swin Transformer和BERT(单模态编码器)或CLIP(一种多模态双编码器)),在预训练期间缺乏稠密的多模态交互,导致与像素级RIS任务之间存在差距。为弥合这一差距,现有的RIS方法通常依赖于两种编码器之间进行多模态融合模块的交互,但这种方法导致高的计算成本。本文提出了一种新颖的RIS方法采用单编码器,即BEiT-3,最大化共享自注意力在所有框架组件中的潜力。这使两种模态从输入到最终预测之间实现无缝交互,产生细粒度对齐的多模态特征。此外,我们提出了轻量且有效的解码器模块,包括共享特征金字塔网络(Shared FPN)和共享掩码解码器(Shared Mask Decoder),这有助于模型的高效性。我们简单的单编码器基线在RIS基准数据集上实现了卓越的性能,同时保持了计算效率,与最新基于双编码器的SOTA方法相比较。

关键词

引用

@article{arxiv.2408.15521,
  title  = {A Simple Baseline with Single-encoder for Referring Image Segmentation},
  author = {Seonghoon Yu and Ilchae Jung and Byeongju Han and Taeoh Kim and Yunho Kim and Dongyoon Wee and Jeany Son},
  journal= {arXiv preprint arXiv:2408.15521},
  year   = {2025}
}

备注

arXiv pre-print