中文

SODAR:通过动态聚合邻域掩码表示进行对象分割

计算机视觉与模式识别 2022-12-27 v2

摘要

近期最先进的单阶段实例分割模型 SOLO 将输入图像划分为网格,并用全卷积网络直接预测每个网格单元的对象掩码,取得了与经典两阶段 Mask R-CNN 相媲美的性能,同时享有更简洁的架构和更高的效率。我们观察到 SOLO 在邻近网格单元上为同一对象生成相似的掩码,这些相邻预测可相互补充,因为某些预测可能更好地分割特定对象部分,然而其中大部分被非极大抑制直接丢弃。受此观察缺口的启发,我们开发了一种新颖的基于学习的聚合方法,在保持架构效率的同时利用丰富的邻域信息改进 SOLO。所得模型命名为 SODAR。与原始的逐网格单元对象掩码不同,SODAR 被隐式监督以学习编码邻近对象几何结构并用上下文补充相邻表示的掩码表示。该聚合方法进一步包含两个新颖设计:1)掩码插值机制,通过邻近网格单元间共享邻域表示使模型生成少得多的掩码表示,从而节省计算与内存;2)可变形邻域采样机制,允许模型自适应调整邻域采样位置,从而聚集具有更相关上下文的掩码表示并获得更高性能。SODAR 显著提升了实例分割性能,例如,在 COCO \texttt{test} 集上以仅约 3% 的额外计算量超越使用 ResNet-101 骨干的 SOLO 模型 2.2 AP。我们进一步展示了在 SOLOv2 模型上一致的性能提升。

关键词

引用

@article{arxiv.2202.07402,
  title  = {SODAR: Segmenting Objects by DynamicallyAggregating Neighboring Mask Representations},
  author = {Tao Wang and Jun Hao Liew and Yu Li and Yunpeng Chen and Jiashi Feng},
  journal= {arXiv preprint arXiv:2202.07402},
  year   = {2022}
}

备注

accepted to IEEE Transactions on Image Processing (TIP), code: https://github.com/advdfacd/AggMask