中文

MatteFormer:基于 Transformer 的通过先验令牌的图像抠图方法

计算机视觉与模式识别 2022-03-30 v1

摘要

在本文中,我们提出了一种基于 Transformer 的图像抠图模型 MatteFormer,该模型在 Transformer 模块中充分利用了 trimap 信息。我们的方法首先引入先验令牌(prior-token),它是每个 trimap 区域(例如前景、背景和未知区域)的全局表示。这些先验令牌被用作全局先验,并参与每个模块的自注意力机制。编码器的每个阶段由 PAST(Prior-Attentive Swin Transformer)块组成,该块基于 Swin Transformer 块,但在几个方面有所不同:1)它具有 PA-WSA(Prior-Attentive Window Self-Attention,先验注意力窗口自注意力)层,不仅与空间令牌(spatial-tokens)而且与先验令牌执行自注意力。2)它具有先验记忆(prior-memory),从先前块中累积保存先验令牌并将其传递到下一个块。我们在常用的图像抠图数据集 Composition-1k 和 Distinctions-646 上评估我们的 MatteFormer。实验结果表明,我们提出的方法以较大优势实现了最先进的(state-of-the-art)性能。我们的代码可在 https://github.com/webtoon/matteformer 获取。

关键词

引用

@article{arxiv.2203.15662,
  title  = {MatteFormer: Transformer-Based Image Matting via Prior-Tokens},
  author = {GyuTae Park and SungJoon Son and JaeYoung Yoo and SeHo Kim and Nojun Kwak},
  journal= {arXiv preprint arXiv:2203.15662},
  year   = {2022}
}