OneRef:基于掩码指涉建模的统一单塔表达式 grounding 与分割
计算机视觉与模式识别
2024-10-28 v2
摘要
受限于视觉和语言的独立编码,现有的 grounding 和指代分割方法严重依赖笨重的 Transformer 基于注意力的 fusion 编码/解码器以及各种早期阶段的交互技术。同时,当前的掩码视觉语言建模(MVLM)未能捕捉指代任务中图像-文本细微的指代关系。在本文中,我们提出了 OneRef,一个建立在模态共享单塔 transformer 之上的极简主义指代框架,统一了视觉和语言特征空间。为建模指代关系,我们引入了一种新颖的 MVLM 范式,称为掩码指涉建模(MRefM),它包含指代感知的掩码图像建模和指代感知的掩码语言建模。这两个模块不仅重建模态相关内容,还跨模态重建指代内容。在 MRefM 中,我们提出了一种基于被指代区域的指代感知动态图像遮挡策略,避免依赖固定比例或通用随机遮挡方案。通过利用统一的视觉语言特征空间并融合 MRefM 建模指代关系的能力,我们的方法实现了对指代结果的直接回归,而无需依赖各种复杂技术。我们的方法在 grounding 和分割任务上 consistently 超越现有方法,并在两者上实现了 SoTA 性能,为未来研究提供了宝贵的见解。我们的代码和模型均可在 https://github.com/linhuixiao/OneRef 提供。
引用
@article{arxiv.2410.08021,
title = {OneRef: Unified One-tower Expression Grounding and Segmentation with Mask Referring Modeling},
author = {Linhui Xiao and Xiaoshan Yang and Fang Peng and Yaowei Wang and Changsheng Xu},
journal= {arXiv preprint arXiv:2410.08021},
year = {2024}
}
备注
Accepted by NeurIPS 2024. The project page: https://github.com/linhuixiao/OneRef