边缘稳定性下的差分隐私优化器动力学
机器学习
2025-12-23 v1
摘要
深度学习模型会透露关于单个训练样本的敏感信息,而差分隐私 (DP) 通过限制此类泄露提供保障,但也以鲜为人知的方式改变优化动力学。我们通过比较梯度下降 (GD) 与 Adam 及其隐私保留变体来研究神经网络在 DP 下的训练动力学。先前工作表明,这些优化器呈现出不同的稳定性动力学:全批方法在边缘稳定性 (EoS) 上训练,而小批和自适应方法表现出类似的边缘稳定性行为。在这些 regime 下,训练损失和锐度——即训练损失 Hessian 最大特征值——表现出特定特征。DP 训练中,按示例梯度裁剪和高斯噪声会修改更新规则,是否保留这些稳定模式尚不明确。我们分析裁剪和噪声如何改变锐度和损失演化,证明 DP 通常会降低锐度,并且可以防止优化器完全到达经典稳定阈值,但来自 EoS 和类似自适应方法的稳定性模式仍然存在,最大学习率和最大隐私预算接近甚至超过这些阈值。这些发现凸显了 DP 在神经网络优化中引入的不可预测性。
引用
@article{arxiv.2512.19019,
title = {Optimizer Dynamics at the Edge of Stability with Differential Privacy},
author = {Ayana Hussain and Ricky Fang},
journal= {arXiv preprint arXiv:2512.19019},
year = {2025}
}
备注
17 pages, 5 figures