用于度量学习等变性的李导数
机器学习
2024-06-19 v2 人工智能
计算机视觉与模式识别
机器学习
摘要
等变性保证模型的预测捕捉数据中的关键对称性。当图像被平移或旋转时,等变模型对该图像的表示也会相应平移或旋转。卷积神经网络的成功历来与其架构中直接编码的平移等变性相关。视觉 transformer 的日益成功挑战了这一叙事——它们没有朝向等变性的显式架构偏置,并暗示增强与训练数据也可能在其性能中扮演重要角色。为更好理解等变性在近期视觉模型中的作用,我们引入李导数,一种具有坚实数学基础且超参数极少的度量等变性的方法。利用李导数,我们研究了数百个预训练模型的等变性质,涵盖 CNN、transformer 与 Mixer 架构。我们分析的大规模使我们得以将架构的影响与模型规模或训练方法等其他因素分离。令人惊讶的是,我们发现许多等变性的违背可归因于普遍网络层(如逐点非线性)中的空间混叠,并且随着模型变大且更精确,无论架构如何,它们往往展现出更多等变性。例如,训练后的 transformer 可以比卷积神经网络更具等变性。
引用
@article{arxiv.2210.02984,
title = {The Lie Derivative for Measuring Learned Equivariance},
author = {Nate Gruver and Marc Finzi and Micah Goldblum and Andrew Gordon Wilson},
journal= {arXiv preprint arXiv:2210.02984},
year = {2024}
}
备注
ICLR 2023. Code available at: https://github.com/ngruver/lie-deriv