Quantile Activation: 纠正 ML 模型的一种失效模式
机器学习
2025-04-04 v3
摘要
标准 ML 模型无法推断上下文分布并恰当地适应。在例如,学习在实际上是由具有矛盾标签的混合分布时会失败。若训练分布与测试分布之间存在偏移,学习也会失败。标准神经网络架构如 MLP 或 CNN 不具备处理这一问题的能力。本文提出一种简单激活函数,量子分位激活 (quantile activation, QAct),在不显著增加计算成本的情况下解决此问题。核心思想是“适应”每个神经元在其上下文分布中的输出。提出的量子分位激活 (QAct) 输出神经元激活在其上下文分布中相对分位位置,区别于传统网络中常见的直接数值输出。在上述失效模式的具体情况之一是存在固有的分布偏移,即测试分布略有不同于训练分布。我们使用设计用于测试对抗扭曲鲁棒性的数据集验证了所提出的激活函数。我们的结果表明,在各种扭曲下,与传统分类器和其他自适应方法相比,本方法在各种架构上实现了显著更好的泛化。尽管本文只是一个概念验证,但我们发现该方法意外地超过了 DINOv2 (small),尽管 DINOv2 是在更大网络和数据集上训练的。
引用
@article{arxiv.2405.11573,
title = {Quantile Activation: Correcting a Failure Mode of ML Models},
author = {Aditya Challa and Sravan Danda and Laurent Najman and Snehanshu Saha},
journal= {arXiv preprint arXiv:2405.11573},
year = {2025}
}