迈向可扩展且稳健的模型版本控制
机器学习
2024-03-12 v2 密码学与安全
摘要
随着深度学习模型在各行业的部署持续扩大,旨在获取这些已部署模型的恶意入侵威胁也在上升。如果攻击者通过服务器漏洞、内部攻击或模型反转技术获取了已部署模型的访问权限,他们就可以构建白盒对抗性攻击来操纵模型的分类结果,从而对依赖这些模型执行关键任务的组织构成重大风险。模型所有者需要机制来保护自己免受此类损失,而无需获取新的训练数据——这一过程通常需要大量的时间和资金投入。在本文中,我们探讨了在不获取新训练数据或不改变模型架构的情况下,生成具有不同攻击属性的多个模型版本的可行性。模型所有者可以一次部署一个版本,并立即用新版本替换泄露的版本。新部署的模型版本能够抵抗利用对一个或所有先前泄露版本的白盒访问生成的对抗性攻击。我们从理论上证明,这可以通过将参数化隐藏分布纳入模型训练数据来实现,迫使模型学习由所选数据唯一定义的与任务无关的特征。此外,隐藏分布的最优选择可以产生一系列能够随时间抵抗复合迁移攻击的模型版本。利用我们的分析见解,我们设计并实现了一种针对 DNN 分类器的实用模型版本控制方法,该方法相比现有方法显著提高了稳健性。我们相信,我们的工作为保护 DNN 服务在初始部署之后的安全提供了一个有前景的方向。
引用
@article{arxiv.2401.09574,
title = {Towards Scalable and Robust Model Versioning},
author = {Wenxin Ding and Arjun Nitin Bhagoji and Ben Y. Zhao and Haitao Zheng},
journal= {arXiv preprint arXiv:2401.09574},
year = {2024}
}
备注
Published in IEEE SaTML 2024