用于两阶段开放词汇分割的提示引导掩码提议
计算机视觉与模式识别
2024-12-16 v1
摘要
我们应对开放词汇分割的挑战,即需要在不同环境中从广泛类别中识别物体,并以文本提示作为输入。为克服这一挑战,现有方法通常使用 CLIP 等多模态模型,在共享嵌入空间中结合图像和文本特征,以弥合有限词汇与广泛词汇识别之间的差距,从而形成一种两阶段方法:在第一阶段,掩码生成器接收输入图像以生成掩码提议;在第二阶段,基于查询选取目标掩码。然而,预期的目标掩码可能不存在于生成的掩码提议中,从而导致意外的输出掩码。在我们的工作中,我们提出了一种名为提示引导掩码提议 (PMP) 的新方法,其中掩码生成器接收输入文本提示,并在这些提示的引导下生成掩码。与无输入提示生成的掩码提议相比,PMP 生成的掩码与输入提示的对齐度更高。为实现 PMP,我们设计了文本 token 与查询 token 之间的交叉注意力机制,能够在每次解码后生成提示引导的掩码提议。我们将 PMP 与采用基于查询的分割主干网络的几项现有工作相结合,在五个基准数据集上的实验证明了该方法的有效性,展示了相较于当前两阶段模型的显著改进(在 mIOU 上有 1% ~ 3% 的绝对性能提升)。在这些基准上的稳定性能提升表明我们提出的轻量级提示感知方法具有有效的泛化能力。
引用
@article{arxiv.2412.10292,
title = {Prompt-Guided Mask Proposal for Two-Stage Open-Vocabulary Segmentation},
author = {Yu-Jhe Li and Xinyang Zhang and Kun Wan and Lantao Yu and Ajinkya Kale and Xin Lu},
journal= {arXiv preprint arXiv:2412.10292},
year = {2024}
}
备注
17 pages. Work done during 2023 summer and has been released