用于指代图像分割的带协同注意力嵌入的编码器融合网络
计算机视觉与模式识别
2021-05-06 v1
摘要
近来,指代图像分割引起了广泛兴趣。以往方法在网络解码侧进行语言与视觉的多模态融合,且语言特征分别与各尺度视觉特征交互,忽略了语言对多尺度视觉特征的连续引导。本文中,我们提出编码器融合网络(EFN),将视觉编码器转变为多模态特征学习网络,并利用语言逐步精炼多模态特征。此外,EFN中嵌入了协同注意力机制以实现多模态特征的并行更新,可促进语义空间中跨模态信息表示的一致性。最后,我们提出边界增强模块(BEM)使网络更关注精细结构。在四个基准数据集上的实验结果表明,所提方法在不同评价指标下无需任何后处理即达到最先进性能。
引用
@article{arxiv.2105.01839,
title = {Encoder Fusion Network with Co-Attention Embedding for Referring Image Segmentation},
author = {Guang Feng and Zhiwei Hu and Lihe Zhang and Huchuan Lu},
journal= {arXiv preprint arXiv:2105.01839},
year = {2021}
}