用于指代图像分割的跨感知早期融合与分阶段视觉和语言Transformer编码器
计算机视觉与模式识别
2024-08-15 v1 人工智能
摘要
指代分割旨在分割与自然语言表达相关的目标对象。该任务的关键挑战在于理解复杂且模糊的语言表达的含义,并通过参考该表达确定包含多个对象的图像中的相关区域。近期模型侧重于在视觉编码器的中间阶段与语言特征进行早期融合,但这些方法存在一个局限性,即语言特征无法参考视觉信息。为了解决这个问题,本文提出了一种新颖的架构——跨感知早期融合与分阶段视觉和语言Transformer编码器(CrossVLT),它允许语言和视觉编码器都执行早期融合,以提高跨模态上下文建模的能力。与先前方法不同,我们的方法使视觉和语言特征能够在每个阶段相互参考对方的信息,从而相互增强两个编码器的鲁棒性。此外,不同于仅依赖高层特征进行跨模态对齐的传统方案,我们引入了一种基于特征的对齐方案,使视觉和语言编码器的低层到高层特征都能参与跨模态对齐。通过在所有编码器阶段对齐中间的跨模态特征,该方案实现了有效的跨模态融合。通过这种方式,所提出的方法简单但有效,用于指代图像分割,并在三个公共基准测试上优于先前的最先进方法。
引用
@article{arxiv.2408.07539,
title = {Cross-aware Early Fusion with Stage-divided Vision and Language Transformer Encoders for Referring Image Segmentation},
author = {Yubin Cho and Hyunwoo Yu and Suk-ju Kang},
journal= {arXiv preprint arXiv:2408.07539},
year = {2024}
}
备注
Published in IEEE Transactions on Multimedia (TMM)