中文

用于无偏视觉识别的因果注意力

计算机视觉与模式识别 2021-08-20 v1

摘要

注意力模块并不总能帮助深度模型学习在任何混淆上下文中都鲁棒的因果特征,例如前景物体特征对不同背景是不变的。这是因为混淆因子诱使注意力捕捉到虚假相关,当训练与测试数据满足 IID(独立同分布)时有助于预测,而当数据为 OOD(分布外)时则损害预测。学习因果注意力的唯一根本解法是通过因果干预,而这需要混淆因子的额外标注,例如分别在“草地+狗”和“道路+狗”中学习“狗”模型,从而使“草地”和“道路”上下文不再混淆“狗”的识别。然而,此类标注不仅极其昂贵,而且本质上存在问题,因为混淆因子在性质上是难以捉摸的。本文中,我们提出一种因果注意力模块(CaaM),以无监督方式自标注混淆因子。具体而言,多个 CaaM 可堆叠并集成到常规注意力 CNN 与自注意力 Vision Transformer 中。在 OOD 设定下,带有 CaaM 的深度模型显著优于不带它的模型;即便在 IID 设定下,注意力的定位也因 CaaM 而改善,显示出在需要鲁棒视觉显著性应用中的巨大潜力。代码见 \url{https://github.com/Wangt-CN/CaaM}。

关键词

引用

@article{arxiv.2108.08782,
  title  = {Causal Attention for Unbiased Visual Recognition},
  author = {Tan Wang and Chang Zhou and Qianru Sun and Hanwang Zhang},
  journal= {arXiv preprint arXiv:2108.08782},
  year   = {2021}
}

备注

Accepted by ICCV 2021