中文

视觉Transformer的统一且具生物合理性的关系图表示

神经与进化计算 2022-06-23 v1 人工智能 计算机视觉与模式识别

摘要

Vision transformer(ViT)及其变体在各种视觉任务中取得了显著成功。这些ViT模型的关键特征是在人工神经网络(ANNs)中采用不同的空间块信息聚合策略。然而,仍缺乏对不同ViT架构的统一表示,以系统性理解和评估模型表示性能。此外,这些表现良好的ViT ANNs与真实生物神经网络(BNNs)的相似性在很大程度上未被探索。为回答这些基本问题,我们首次提出一种统一且具生物合理性的ViT模型关系图表示。具体而言,所提关系图表示由两个关键子图组成:聚合图与仿射图。前者将ViT令牌视为节点并描述其空间交互,后者将网络通道视为节点并反映通道间的信息通信。利用该统一关系图表示,我们发现:a) 聚合图的甜点区可带来预测性能显著改善的ViTs;b) 聚类系数和平均路径长度的图度量是模型预测性能的有效指标,尤其在应用于小样本数据集时;c) 我们的发现跨多种ViT架构和多个数据集一致;d) 所提ViT关系图表示与脑科学数据导出的真实BNNs具有高相似性。总体而言,我们的工作为更具可解释性和有效的ViT ANNs表示提供了一种新颖的统一且具生物合理性的范式。

关键词

引用

@article{arxiv.2206.11073,
  title  = {A Unified and Biologically-Plausible Relational Graph Representation of Vision Transformers},
  author = {Yuzhong Chen and Yu Du and Zhenxiang Xiao and Lin Zhao and Lu Zhang and David Weizhong Liu and Dajiang Zhu and Tuo Zhang and Xintao Hu and Tianming Liu and Xi Jiang},
  journal= {arXiv preprint arXiv:2206.11073},
  year   = {2022}
}

备注

11 pages,7 figures, submitted to 36th Conference on Neural Information Processing Systems (NeurIPS 2022)