可证明安全的模型更新
机器学习
2026-03-19 v2 机器学习
摘要
安全关键环境本质上是动态的。分布迁移、新兴漏洞和不断演变的要求要求对机器学习模型进行持续更新。然而,即使是温和的参数更新也可能产生意外后果,如经典模型中的灾难性遗忘或基础模型中的对齐漂移。现有的启发式方法(如正则化、参数隔离)可以缓解这些效果,但无法 certify 更新后的模型是否继续满足所需的性能规范。我们通过引入可证明安全模型更新框架来解决这一问题。我们的 метод首先将问题形式化为计算最大局部不变域(LID):参数空间中的一个连通区域,所有点都被 certify 满足给定规范。虽然精确的最大 LID 计算不可行,但我们表明,将问题松弛为参数化抽象域(正交体、齐次体)可获得可行的原始-对偶 formulation。这使得能够通过将其投射到安全域来高效 certify 更新——且与所用的数据或算法无关。我们的 formulation 进一步允许计算多个约最优 LID、纳入正则化激励的偏差以及使用前瞻数据缓冲区。跨持续学习和基础模型微调基准测试,我们的方法在避免遗忘方面匹配或超过启发式基准,同时提供形式化的安全保证。
引用
@article{arxiv.2512.01899,
title = {Provably Safe Model Updates},
author = {Leo Elmecker-Plakolm and Pierre Fasterling and Philip Sosnin and Calvin Tsay and Matthew Wicker},
journal= {arXiv preprint arXiv:2512.01899},
year = {2026}
}
备注
12 pages, 9 figures. This work has been accepted for publication at SaTML 2026. The final version will be available on IEEE Xplore