SOTR:基于 Transformer 的实例分割模型
计算机视觉与模式识别
2021-08-18 v2
摘要
近期多数基于 transformer 的模型在视觉任务上表现出令人印象深刻的性能,甚至优于卷积神经网络(CNN)。本工作中,我们提出一种新颖、灵活且高效的基于 transformer 的模型,用于高质量实例分割。所提方法 Segmenting Objects with TRansformers(SOTR)简化了分割流程,构建于一种替代性 CNN 骨干网络之上,并附加两个并行子任务:(1)通过 transformer 预测逐实例类别;(2)利用多级上采样模块动态生成分割掩码。SOTR 可通过特征金字塔网络(FPN)与孪生 transformer 分别有效提取低层特征表示并捕获长程上下文依赖。同时,相较于原始 transformer,所提孪生 transformer 因仅涉及一行与一列注意力来编码像素而具有时间与资源高效性。此外,SOTR 易于与各类 CNN 骨干网络及 transformer 模型变体结合,从而显著提升分割精度与训练收敛性。大量实验表明,我们的 SOTR 在 MS COCO 数据集上表现良好,并超越当前最优(SOTA)实例分割方法。我们希望这一简洁而强大的框架能作为实例级识别的优选基线。我们的代码见 https://github.com/easton-cau/SOTR。
引用
@article{arxiv.2108.06747,
title = {SOTR: Segmenting Objects with Transformers},
author = {Ruohao Guo and Dantong Niu and Liao Qu and Zhenbo Li},
journal= {arXiv preprint arXiv:2108.06747},
year = {2021}
}
备注
ICCV 2021