以最大类分离作为单一矩阵中的归纳偏置
机器学习
2022-10-25 v2 计算机视觉与模式识别
摘要
最大化类间分离是机器学习中一种众所周知的归纳偏置,也是许多传统算法的支柱。默认情况下,深度网络并不具备这种归纳偏置,因此人们通过微分优化提出了许多替代方案。当前方法倾向于联合优化分类与分离:将输入与类向量对齐,并在角度上分离类向量。本文提出了一种简单的替代方案:在计算 softmax 激活之前添加一个固定的矩阵乘法,将最大分离编码为网络中的归纳偏置。我们方法背后的主要观察是,分离不需要优化,而是可以在训练前以闭式解求出并插入网络中。我们概述了一种递归方法,以获得由任意数量类的最大可分离向量组成的矩阵,该矩阵可以以可忽略的工程投入和计算开销添加。尽管性质简单,这一矩阵乘法带来了实际影响。我们表明,从 CIFAR 到 ImageNet,我们的方案直接提升了分类、长尾识别、分布外检测和开集识别。我们通过经验发现,最大分离作为固定偏置效果最佳;使矩阵可学习对性能毫无增益。用于复现实验的闭式实现和代码已在 github 上提供。
引用
@article{arxiv.2206.08704,
title = {Maximum Class Separation as Inductive Bias in One Matrix},
author = {Tejaswi Kasarla and Gertjan J. Burghouts and Max van Spengler and Elise van der Pol and Rita Cucchiara and Pascal Mettes},
journal= {arXiv preprint arXiv:2206.08704},
year = {2022}
}