BadGD:识别梯度下降算法脆弱性的数据中心统一框架
机器学习
2024-05-28 v1 密码学与安全
机器学习
摘要
我们提出了 BadGD,一个统一的理论框架,通过战略性后门攻击揭示梯度下降算法的脆弱性。后门攻击涉及将恶意触发器嵌入训练数据集以破坏模型的学习过程。我们的框架引入了三个新型构造:最大风险扭曲触发器(Max RiskWarp Trigger)、最大梯度扭曲触发器(Max GradWarp Trigger)以及最大梯度分布扭曲触发器(Max GradDistWarp Trigger),每个构造均旨在通过扭曲经验风险、确定性梯度和随机梯度来利用梯度下降的特定方面。我们严格定义干净数据集和后门数据集,并提供数学公式以评估这些恶意后门触发器造成的扭曲。通过衡量这些触发器对模型训练过程的影响,我们的框架将现有经验性发现与理论见解相连接,展示了恶意方如何利用梯度下降的超参数以最大化攻击效果。在特别是,我们展示了这些利用会显著改变损失景观和梯度计算,从而导致模型完整性和性能受损。本研究强调了此类数据中心攻击所构成的严重威胁,并凸显了针对机器学习系统可靠性和安全性需要完善防御措施的紧迫性。BadGD 为理解和缓解对抗性操纵设立了新标准,确保 AI 系统的可靠性和安全性。
引用
@article{arxiv.2405.15979,
title = {BadGD: A unified data-centric framework to identify gradient descent vulnerabilities},
author = {Chi-Hua Wang and Guang Cheng},
journal= {arXiv preprint arXiv:2405.15979},
year = {2024}
}
备注
25 pages, 1 figure