视觉Transformer的弯曲表示空间
计算机视觉与模式识别
2023-12-15 v2
摘要
具有自注意力(即Transformer)的神经网络如ViT和Swin已成为传统卷积神经网络(CNNs)的更优替代。然而,我们对新架构如何运作的理解仍有限。本文关注如下现象:Transformer相比CNN对 corruption 表现出更高鲁棒性,却不表现出过度自信。这与鲁棒性随置信度增加的直觉相反。我们通过实证考察当输入数据在小区域内线性移动时,倒数第二层输出在表示空间中的运动,解决了这一矛盾。具体地,我们展示如下。(1)CNN在输入与输出运动间呈现相当线性的关系,而Transformer对某些数据呈现非线性关系;对那些数据,当输入线性移动时,Transformer的输出沿弯曲轨迹运动。(2)当数据位于弯曲区域时,难以将其移出决策区域,因为输出沿弯曲轨迹而非直线朝向决策边界运动,导致Transformer的高鲁棒性。(3)若对数据稍作修改使其跳出弯曲区域,后续运动变为线性且输出直接走向决策边界。换言之,数据附近确实存在决策边界,仅因弯曲表示空间而难以发现。这解释了Transformer的低置信预测。此外,我们考察了注意力操作中对线性扰动产生非线性响应的数学性质。最后,我们分享了关于什么促成了Transformer弯曲表示空间、以及弯曲度在训练中如何演化的额外发现。
引用
@article{arxiv.2210.05742,
title = {Curved Representation Space of Vision Transformers},
author = {Juyeop Kim and Junha Park and Songkuk Kim and Jong-Seok Lee},
journal= {arXiv preprint arXiv:2210.05742},
year = {2023}
}
备注
AAAI 2024