中文

视觉依存 Transformer:依存树从反向注意力中涌现

计算机视觉与模式识别 2023-04-07 v1

摘要

人类拥有一种多功能的机制,可以提取视觉世界的结构化表示。在观察图像时,我们可以将场景分解为实体及其组成部分,并获取它们之间的依存关系。为了模仿这种能力,我们提出了视觉依存 Transformer (Visual Dependency Transformers, DependencyViT),它可以在没有任何标签的情况下诱导视觉依存关系。我们通过一种名为反向注意力的新型神经算子实现了这一点,该算子能够自然地捕捉图像块之间的长距离视觉依存关系。具体而言,我们将其表述为一个依存图,其中反向注意力中的子词元被训练为关注其父词元,并遵循归一化概率分布发送信息,而不是像传统自注意力那样收集信息。通过这种设计,层次结构自然地从反向注意力层中涌现,并且依存树从叶节点到根节点以无监督方式逐步诱导出来。DependencyViT 提供了几个吸引人的好处。(i) 图像中的实体及其部分由不同的子树表示,从而能够根据依存关系进行部分划分;(ii) 动态视觉池化成为可能。很少发送消息的叶节点可以被剪枝而不会阻碍模型性能,基于此我们提出了轻量级的 DependencyViT-Lite,以减少计算和内存占用;(iii) DependencyViT 在 ImageNet 上的自监督和弱监督预训练范式中均表现良好,并在 8 个数据集和 5 个任务(例如无监督部分与显著性分割、识别和检测)上证明了其有效性。

关键词

引用

@article{arxiv.2304.03282,
  title  = {Visual Dependency Transformers: Dependency Tree Emerges from Reversed Attention},
  author = {Mingyu Ding and Yikang Shen and Lijie Fan and Zhenfang Chen and Zitian Chen and Ping Luo and Joshua B. Tenenbaum and Chuang Gan},
  journal= {arXiv preprint arXiv:2304.03282},
  year   = {2023}
}

备注

CVPR 2023