中文

面向图像抠图的形态感知全局注意力

计算机视觉与模式识别 2024-11-18 v1

摘要

视觉 Transformer (ViT) 和卷积神经网络 (CNN) 在图像抠图中面临固有挑战,特别是在保留精细结构细节方面。ViT 依靠自注意力机制拥有全局感受野,却常丢失发丝等局部细节;反之,CNN 受限于局部感受野,虽通过深层网络逼近全局上下文,但在更深层难以保留精细结构。为克服这些局限,我们提出了一种新颖的形态感知全局注意力 (Morpho-Aware Global Attention, MAGA) 机制,旨在有效捕捉精细结构的形态。MAGA 采用类俄罗斯方块的卷积模式来对齐精细结构的局部形状,确保最优的局部对应关系,同时保持对形态细节的敏感性。提取的局部形态信息作为查询嵌入,投影到全局键嵌入上,以在更广泛的上下文中强调局部细节。随后投影到值嵌入上,MAGA 将这些被强调的形态细节无缝融合为统一的全局结构。这种方法使 MAGA 能够同时关注局部形态并将这些细节统一为一个连贯的整体,从而有效保留精细结构。大量实验表明,基于 MAGA 的 ViT 取得了显著性能提升,在两个基准测试中平均将 SAD 降低 4.3%、MSE 降低 39.5%,超越了最先进方法。

关键词

引用

@article{arxiv.2411.10251,
  title  = {Morpho-Aware Global Attention for Image Matting},
  author = {Jingru Yang and Chengzhi Cao and Chentianye Xu and Zhongwei Xie and Kaixiang Huang and Yang Zhou and Shengfeng He},
  journal= {arXiv preprint arXiv:2411.10251},
  year   = {2024}
}