神经正切核能告诉我们关于对抗鲁棒性的什么信息?
机器学习
2023-02-01 v2 密码学与安全
摘要
神经网络的对抗脆弱性及随后构建鲁棒模型的技术引起了广泛关注;然而我们仍缺乏对这一现象的完整理解。在此,我们通过近期连接神经网络与核方法的理论进展所提供的分析工具,即神经正切核(NTK),研究了训练神经网络的对抗样本,延续了利用 NTK 近似成功分析重要深度学习现象并为新应用设计算法的大量工作。我们展示了 NTK 如何允许以“免训练”的方式生成对抗样本,并证明它们可以迁移并欺骗其在“惰性”机制下的有限宽度神经网络对应物。我们利用这一联系提供了对鲁棒与非鲁棒特征的替代视角,这些特征被认为是神经网络对抗脆弱性的基础。具体而言,我们定义并研究了由核特征分解诱导的特征,以更好地理解鲁棒与非鲁棒特征的作用、标准分类对两者的依赖以及鲁棒性-准确性权衡。我们发现此类特征在不同架构间惊人地一致,且鲁棒特征往往对应于模型的最大特征值,因此在训练早期被学习。我们的框架允许我们识别并可视化非鲁棒但有用的特征。最后,我们阐明了实践中所用神经网络对抗训练底层的鲁棒性机制:通过量化相关经验 NTK 的演化,我们证明其动力学更早地落入“惰性”机制,并展现出比标准训练强得多的优先在核顶部特征空间中学习特征的已知偏置。
引用
@article{arxiv.2210.05577,
title = {What Can the Neural Tangent Kernel Tell Us About Adversarial Robustness?},
author = {Nikolaos Tsilivis and Julia Kempe},
journal= {arXiv preprint arXiv:2210.05577},
year = {2023}
}
备注
NeurIPS 2022; added link to GitHub repository