深度神经网络的集合值灵敏度分析
机器学习
2024-12-17 v1 人工智能
摘要
本文提出一种基于集合值映射的灵敏度分析框架,用于理解和计算深度神经网络(DNN)的解(模型权重)如何响应训练数据中的扰动。由于DNN可能不存在唯一解(极小值),且求解DNN的算法可能因输入数据轻微扰动而导致不同解,故我们关注DNN解集的灵敏度,而非研究单个解。特别地,我们关注解集相对于数据扰动的扩张和收缩。如果解集的变化可以由数据扰动的程度进行界定,则该模型被称为具有类似 Lipschitz 性质。这种“集合-到-集合”分析方法提供了对DNN在训练期间鲁棒性和可靠性的更深入理解。我们的框架包含孤立极小值和非孤立极小值,关键在于无需假设损失函数的 Hessian 为非奇异。通过发展集合水平指标(如集合间距离、集合收敛、集合值映射的导数以及解集上的稳定性),我们证明了全连接神经网络的解集具有类似 Lipschitz 的性质。对于一般神经网络(如 ResNet),我们引入基于图导数的方法,在无需重新训练的情况下估计数据扰动后的新解集。
关键词
引用
@article{arxiv.2412.11057,
title = {Set-Valued Sensitivity Analysis of Deep Neural Networks},
author = {Xin Wang and Feilong Wang and Xuegang Ban},
journal= {arXiv preprint arXiv:2412.11057},
year = {2024}
}