DynaMITe:用于多目标交互式分割Transformer的动态查询引导方法
计算机视觉与模式识别
2023-08-23 v2
摘要
大多数最先进的实例分割方法依赖于大量像素级精确标注进行训练,而这类标注的创建成本高昂。交互式分割网络基于图像及相应的用户交互(如点击)来帮助生成此类标注。该任务的现有方法一次只能处理单个实例,且每次用户交互都需要通过整个深度网络进行一次完整的前向传播。我们提出了一种更高效的方法,称为DynaMITe,其中我们将用户交互表示为对Transformer解码器的时空查询,具有在单次迭代中分割多个目标实例的潜力。我们的架构还免去了在细化过程中重新计算图像特征的需要,并且与其他方法相比,在单幅图像中分割多个实例所需的交互更少。DynaMITe在多个现有交互式分割基准以及我们在本文中提出的新多实例基准上均取得了最先进(SOTA)的结果。
引用
@article{arxiv.2304.06668,
title = {DynaMITe: Dynamic Query Bootstrapping for Multi-object Interactive Segmentation Transformer},
author = {Amit Kumar Rana and Sabarinath Mahadevan and Alexander Hermans and Bastian Leibe},
journal= {arXiv preprint arXiv:2304.06668},
year = {2023}
}
备注
Accepted to ICCV 2023