结构状态空间模型的隐式偏好可被干净标签所中毒
机器学习
2025-12-16 v5 机器学习
摘要
神经网络由一种隐式偏好驱动:梯度下降倾向于以能够对未见数据进行泛化的方式拟合训练数据。最近一类 gaining traction 的神经网络模型是结构状态空间模型 (SSMs),被视为变 Transformer 的高效替代方案。先前的工作认为 SSMs 的隐式偏好导致在数据由低维教师生成的setting中实现泛化。在本文中,我们重新审视了后者的setting,正式建立了先前工作未检测到的一种现象。也就是说,尽管在许多训练数据的选择下,隐式偏好导致泛化,但存在特殊的训练样本,其包含会完全扭曲隐式偏好,以至于泛化失败。这种失败即使这些特殊训练样本由教师标记(即具有干净标签)也会发生!我们通过实验证明了这一现象,SSMs 可独立训练,也可作为非线性神经网络的一部分训练。在对抗机器学习领域,用干净标签的训练样本破坏泛化已称为干净标签中毒。在 SSMs 的快速普及背景下,我们认为阐明其对干净标签中毒的脆弱性,以及 developing 克服此脆弱性的方法,都是至关重要的研究方向。
引用
@article{arxiv.2410.10473,
title = {The Implicit Bias of Structured State Space Models Can Be Poisoned With Clean Labels},
author = {Yonatan Slutzky and Yotam Alexander and Noam Razin and Nadav Cohen},
journal= {arXiv preprint arXiv:2410.10473},
year = {2025}
}
备注
Accepted to NeurIPS 2025