中文

用于指代图像分割的带协同注意力嵌入的编码器融合网络

计算机视觉与模式识别 2021-05-06 v1

摘要

近来,指代图像分割引起了广泛兴趣。以往方法在网络解码侧进行语言与视觉的多模态融合,且语言特征分别与各尺度视觉特征交互,忽略了语言对多尺度视觉特征的连续引导。本文中,我们提出编码器融合网络(EFN),将视觉编码器转变为多模态特征学习网络,并利用语言逐步精炼多模态特征。此外,EFN中嵌入了协同注意力机制以实现多模态特征的并行更新,可促进语义空间中跨模态信息表示的一致性。最后,我们提出边界增强模块(BEM)使网络更关注精细结构。在四个基准数据集上的实验结果表明,所提方法在不同评价指标下无需任何后处理即达到最先进性能。

关键词

引用

@article{arxiv.2105.01839,
  title  = {Encoder Fusion Network with Co-Attention Embedding for Referring Image Segmentation},
  author = {Guang Feng and Zhiwei Hu and Lihe Zhang and Huchuan Lu},
  journal= {arXiv preprint arXiv:2105.01839},
  year   = {2021}
}