基于多尺度方法的通用少样本分割的视觉提示
计算机视觉与模式识别
2024-04-19 v1
摘要
注意力机制 transformer模型的出现导致其广泛用于各种任务,由于其卓越的泛化和迁移性能。最近的研究表明,这些模型在获得适当提示后对于少样本推理效果极佳。然而,这些技术在类似语义分割这样的稠密预测任务上仍受到 insufficient 关注。在本文中,我们考察了使用学习型视觉提示来提示 transformer 解码器,以实现通用少样本分割(GFSS)任务的有效性。我们的目标是在新类别仅凭有限示例的情况下获得卓越性能,同时保持对 base 类别的性能。我们提出了一种学习有限示例下视觉提示的方法。这些学习型视觉提示用于提示多尺度 transformer 解码器,以促进准确的稠密预测。此外,我们引入了一种在 novel prompts(使用有限示例学习)和 base prompts(使用丰富数据学习)之间进行单向因果注意力机制。这一机制在不损害 base 类性能的前提下丰富了 novel prompts。总体而言,这种提示方式帮助我们在两个不同的基准数据集上实现了GFSS的状态-of-the-art性能:COCO-和Pascal-,无需测试时优化(或 transduction)。此外,可以利用无标签测试数据进行测试时优化,以提高提示效果,我们称之为 transductive prompt tuning。
引用
@article{arxiv.2404.11732,
title = {Visual Prompting for Generalized Few-shot Segmentation: A Multi-scale Approach},
author = {Mir Rayat Imtiaz Hossain and Mennatullah Siam and Leonid Sigal and James J. Little},
journal= {arXiv preprint arXiv:2404.11732},
year = {2024}
}
备注
Accepted at CVPR 2024