中文

可微分软掩码注意力

计算机视觉与模式识别 2022-08-08 v2

摘要

Transformer 因其在建模复杂运算时的性能与灵活性,已在计算机视觉中变得普遍。其中尤为重要的是“交叉注意力”操作,它允许向量表示(例如图像中某对象)通过关注任意大小的输入特征集来学习。近来提出了“掩码注意力”,其中给定对象表示仅关注该对象分割掩码激活的那些图像像素特征。这种注意力的特化已证明有益于多种图像与视频分割任务。本文中,我们提出注意力的另一种特化,其支持在“软掩码”(具有连续掩码概率而非二值)上关注,并且在这些掩码概率下也可微分,从而允许用于注意力的掩码在网络内学习而无需直接的损失监督。这可用于若干应用。具体地,我们将“可微分软掩码注意力”用于弱监督视频对象分割(VOS)任务,其中我们开发了基于 Transformer 的 VOS 网络,其训练仅需单张标注图像帧,但也可从仅含一帧标注的视频的循环一致性训练中获益。尽管未标注帧没有掩码损失,由于我们的新颖注意力公式,网络仍能在那些帧中分割对象。代码:https://github.com/Ali2500/HODOR/blob/main/hodor/modelling/encoder/soft_masked_attention.py

关键词

引用

@article{arxiv.2206.00182,
  title  = {Differentiable Soft-Masked Attention},
  author = {Ali Athar and Jonathon Luiten and Alexander Hermans and Deva Ramanan and Bastian Leibe},
  journal= {arXiv preprint arXiv:2206.00182},
  year   = {2022}
}

备注

arXiv admin note: text overlap with arXiv:2112.09131