Visual Parser:用 Transformer 表示部分-整体层次结构
计算机视觉与模式识别
2022-01-11 v2
摘要
人类视觉能够从整个场景中捕获部分-整体层次信息。本文提出 Visual Parser(ViP),用 transformer 显式构建此类层次结构。ViP 将视觉表示划分为两个层级:部分级和整体级。每个部分的信息表示整体中若干独立向量的组合。为对这两个层级的表示建模,我们首先通过注意力机制将整体信息编码为部分向量,再将部分向量中的全局信息解码回整体表示。通过所提出的编码器-解码器交互迭代解析两个层级,模型可逐步精炼两个层级上的特征。实验结果表明,ViP 在分类、检测和实例分割三项主要任务上均取得极具竞争力的性能。尤其在目标检测上大幅超越此前的 SOTA CNN 骨干网络。ViP 系列中的微小模型参数量减少 、FLOPS 减少 ,仍可与 ResNe(X)t 系列最大模型 ResNeXt-101-644d 性能相当。可视化结果还表明,所学部分对预测类别具有高度指示性,使 ViP 比以往基础架构更具可解释性。代码见 https://github.com/kevin-ssy/ViP。
引用
@article{arxiv.2107.05790,
title = {Visual Parser: Representing Part-whole Hierarchies with Transformers},
author = {Shuyang Sun and Xiaoyu Yue and Song Bai and Philip Torr},
journal= {arXiv preprint arXiv:2107.05790},
year = {2022}
}