ISTR:基于 Transformer 的端到端实例分割
计算机视觉与模式识别
2021-05-07 v2
摘要
端到端范式显著提升了各类基于深度学习的计算机视觉模型的精度。为此,目标检测等任务已通过替换非端到端组件得到升级,例如基于二分图匹配的集合损失训练以消除非极大值抑制。然而,由于实例分割相较目标检测输出维度显著更高,此类升级并不适用于实例分割。本文提出一种称为 ISTR 的实例分割 Transformer,是此类首个端到端框架。ISTR 预测低维掩码嵌入,并将其与真实掩码嵌入匹配以计算集合损失。此外,ISTR 采用循环细化策略同步进行检测与分割,相较于现有的自顶向下与自底向上框架,提供了一种实现实例分割的新途径。得益于所提端到端机制,ISTR 即便使用基于近似的次优嵌入也展现出最先进的性能。具体而言,在 MS COCO 数据集上,ISTR 使用 ResNet50-FPN 取得 46.8/38.6 的 box/mask AP,使用 ResNet101-FPN 取得 48.1/39.9 的 box/mask AP。定量与定性结果揭示了 ISTR 作为实例级识别坚实基线的良好潜力。代码已发布于:https://github.com/hujiecpp/ISTR。
引用
@article{arxiv.2105.00637,
title = {ISTR: End-to-End Instance Segmentation with Transformers},
author = {Jie Hu and Liujuan Cao and Yao Lu and ShengChuan Zhang and Yan Wang and Ke Li and Feiyue Huang and Ling Shao and Rongrong Ji},
journal= {arXiv preprint arXiv:2105.00637},
year = {2021}
}