中文

通过凸对偶性揭示注意力机制:视觉Transformer的分析与解释

机器学习 2022-05-23 v2 计算机视觉与模式识别 最优化与控制

摘要

使用自注意力或其提出的替代方案的视觉Transformer在许多图像相关任务中展示了有前景的结果。然而,注意力机制所蕴含的归纳偏置尚未被充分理解。为解决这一问题,本文通过凸对偶性的视角分析注意力机制。对于非线性点积自注意力以及MLP-mixer和傅里叶神经算子等替代机制,我们推导出等价的有限维凸问题,这些问题可解释且可求解至全局最优。这些凸规划引出了{\it 块核范数正则化},该正则化促进了潜在特征和令牌维度上的低秩性。特别地,我们展示了自注意力网络如何基于令牌的潜在相似性隐式地对令牌进行聚类。我们进行了实验,通过微调多种凸注意力头,将预训练的Transformer骨干网络迁移到CIFAR-100分类任务中。结果表明,与现有的MLP或线性头相比,注意力机制所诱导的偏置具有优势。

关键词

引用

@article{arxiv.2205.08078,
  title  = {Unraveling Attention via Convex Duality: Analysis and Interpretations of Vision Transformers},
  author = {Arda Sahiner and Tolga Ergen and Batu Ozturkler and John Pauly and Morteza Mardani and Mert Pilanci},
  journal= {arXiv preprint arXiv:2205.08078},
  year   = {2022}
}

备注

38 pages, 2 figures. To appear in ICML 2022