中文

AutoFocusFormer:脱离网格的图像分割

计算机视觉与模式识别 2023-10-27 v2

摘要

真实世界图像的内容密度常高度不平衡。某些区域非常均匀,例如大片蓝天,而其他区域散布许多小物体。然而,卷积深度网络中常用的连续网格下采样策略对所有区域一视同仁。因此,小物体仅以极少空间位置表示,导致分割等任务结果变差。直观上,在下采样时保留更多代表小物体的像素有助于保存重要信息。为此,我们提出AutoFocusFormer(AFF),一种局部注意力transformer图像识别骨干网络,其通过学习保留任务最关键像素来实现自适应下采样。由于自适应下采样生成一组在图像平面上不规则分布的像素,我们摒弃经典网格结构。相反,我们开发了新颖的基于点的局部注意力模块,由平衡聚类模块与可学习邻域合并模块促成,为我们基于点的前沿分割头版本提供表征。实验表明,我们的AutoFocusFormer(AFF)相较同等规模基线模型有显著提升。

关键词

引用

@article{arxiv.2304.12406,
  title  = {AutoFocusFormer: Image Segmentation off the Grid},
  author = {Chen Ziwen and Kaushik Patnaik and Shuangfei Zhai and Alvin Wan and Zhile Ren and Alex Schwing and Alex Colburn and Li Fuxin},
  journal= {arXiv preprint arXiv:2304.12406},
  year   = {2023}
}

备注

CVPR 2023