中文

Visual Parser:用 Transformer 表示部分-整体层次结构

计算机视觉与模式识别 2022-01-11 v2

摘要

人类视觉能够从整个场景中捕获部分-整体层次信息。本文提出 Visual Parser(ViP),用 transformer 显式构建此类层次结构。ViP 将视觉表示划分为两个层级:部分级和整体级。每个部分的信息表示整体中若干独立向量的组合。为对这两个层级的表示建模,我们首先通过注意力机制将整体信息编码为部分向量,再将部分向量中的全局信息解码回整体表示。通过所提出的编码器-解码器交互迭代解析两个层级,模型可逐步精炼两个层级上的特征。实验结果表明,ViP 在分类、检测和实例分割三项主要任务上均取得极具竞争力的性能。尤其在目标检测上大幅超越此前的 SOTA CNN 骨干网络。ViP 系列中的微小模型参数量减少 7.2×7.2\times、FLOPS 减少 10.9×10.9\times,仍可与 ResNe(X)t 系列最大模型 ResNeXt-101-64×\times4d 性能相当。可视化结果还表明,所学部分对预测类别具有高度指示性,使 ViP 比以往基础架构更具可解释性。代码见 https://github.com/kevin-ssy/ViP。

关键词

引用

@article{arxiv.2107.05790,
  title  = {Visual Parser: Representing Part-whole Hierarchies with Transformers},
  author = {Shuyang Sun and Xiaoyu Yue and Song Bai and Philip Torr},
  journal= {arXiv preprint arXiv:2107.05790},
  year   = {2022}
}