视觉与语言同步:面向指代图像分割的双向令牌掩码自编码器
计算机视觉与模式识别
2023-12-01 v1
摘要
指代图像分割(RIS)旨在以像素级在场景中分割自然语言描述的目标对象。近期多种RIS模型通过从预训练编码器生成上下文令牌来建模多模态特征,并利用基于transformer的跨模态注意力有效融合它们,从而取得了最先进的性能。尽管这些方法将语言特征与图像特征匹配以有效识别可能的目标对象,但它们往往难以正确理解复杂且模糊的句子与场景中的上下文信息。为解决此问题,我们受掩码自编码器(MAE)启发,提出了一种新颖的双向令牌掩码自编码器(BTMAE)。所提模型通过在令牌级别重建图像与语言特征中缺失的特征,来学习图像到语言及语言到图像的上下文。换言之,该方法侧重于让网络理解两种模态间相互关联的深层上下文信息,从而实现图像与语言特征的相互补充。这种学习方法增强了RIS在复杂句子与场景中的性能鲁棒性。我们的BTMAE在三个流行数据集上取得了最先进的性能,并通过多种消融实验证明了所提方法的有效性。
引用
@article{arxiv.2311.17952,
title = {Synchronizing Vision and Language: Bidirectional Token-Masking AutoEncoder for Referring Image Segmentation},
author = {Minhyeok Lee and Dogyoon Lee and Jungho Lee and Suhwan Cho and Heeseung Choi and Ig-Jae Kim and Sangyoun Lee},
journal= {arXiv preprint arXiv:2311.17952},
year = {2023}
}