SOIT:基于实例感知 Transformer 的实例分割目标
计算机视觉与模式识别
2021-12-24 v2
摘要
本文提出了一个端到端的实例分割框架,称为 SOIT,其利用实例感知 Transformer 分割目标。受 DETR \cite{carion2020end} 启发,我们的方法将实例分割视为一个直接的集合预测问题,并有效去除了许多手工设计的组件,如 RoI 裁剪、一对多标签分配和非极大值抑制(NMS)。在 SOIT 中,多个查询被学习以在全局图像上下文下并行直接推理出一组具有语义类别、边界框位置和逐像素掩码的 object embeddings。类别与边界框可由定长向量轻松嵌入。特别地,逐像素掩码由一组参数嵌入以构建轻量级实例感知 Transformer。随后,由该实例感知 Transformer 生成全分辨率掩码,而不涉及任何基于 RoI 的操作。总体而言,SOIT 引入了一个简单且无需 RoI 与 NMS 的单阶段实例分割框架。在 MS COCO 数据集上的实验结果表明,SOIT 显著优于当前最优的实例分割方法。此外,在统一查询嵌入中联合学习多个任务也能大幅提升检测性能。代码见 \url{https://github.com/yuxiaodongHRI/SOIT}。
引用
@article{arxiv.2112.11037,
title = {SOIT: Segmenting Objects with Instance-Aware Transformers},
author = {Xiaodong Yu and Dahu Shi and Xing Wei and Ye Ren and Tingqun Ye and Wenming Tan},
journal= {arXiv preprint arXiv:2112.11037},
year = {2021}
}
备注
AAAI 2022