对在线学习器的攻击:一种师生分析
机器学习
2023-11-01 v2 无序系统与神经网络
统计力学
密码学与安全
机器学习
摘要
机器学习模型众所周知易受对抗攻击:即对数据的微小特定扰动可灾难性地改变模型预测。尽管大量文献研究了预训练模型的测试时攻击,但在线学习设定下的攻击这一重要情形迄今很少受到关注。在本工作中,我们采用控制理论的视角研究攻击者可能扰动数据标签以操纵在线学习器学习动力学的场景。我们在师生设定下对问题进行了理论分析,考虑了不同的攻击策略,并得到了简单线性学习器稳态的解析结果。这些结果使我们能够证明当攻击强度超过临界阈值时,学习器精度发生不连续相变。随后我们使用真实数据对具有复杂架构的学习器上的攻击进行了实证研究,证实了理论分析的见解。我们的发现表明,贪婪攻击可能极其高效,尤其在数据以小批量流式到达时。
引用
@article{arxiv.2305.11132,
title = {Attacks on Online Learners: a Teacher-Student Analysis},
author = {Riccardo Giuseppe Margiotta and Sebastian Goldt and Guido Sanguinetti},
journal= {arXiv preprint arXiv:2305.11132},
year = {2023}
}
备注
19 pages, 10 figures