中文

鲁棒权重签名:像修补权重一样轻松获得鲁棒性?

机器学习 2023-02-27 v1

摘要

给定一个被训练为对一种或多种分布偏移(例如自然图像损坏)具有韧性的鲁棒模型,这种“鲁棒性”是如何编码在模型权重中的,又如何能轻易地被解耦和/或“零样本”迁移到其他模型?本文通过经验研究给出了一个令人惊讶的简单答案:线性地——通过直接的模型权重算术!我们首先得出几个关键观察:(1)假设我们在干净数据集及其损坏版本上训练相同模型架构,所得权重主要在浅层存在差异;(2)投影后的权重差异(我们称之为“鲁棒权重签名”(Robust Weight Signature, RWS))对不同损坏类型具有判别性与指示性;(3)对于同一损坏类型,一个模型架构获得的 RWS 在不同数据集间高度一致且可迁移。我们提出一个极简的模型鲁棒性“修补”框架,该框架携带在干净数据上训练的模型及其预提取的 RWS。如此,向模型注入特定鲁棒性简化为直接将相应 RWS 加到其权重上。我们验证所提框架显著具有:(1)轻量性,因为 RWS 集中于最浅几层,且我们进一步表明它们可轻松量化,存储一个 RWS 比存储完整权重副本紧凑多达 13 倍;(2)原位可调性,RWS 可按需附加,之后移除以恢复完好干净模型,我们进一步展示可线性重缩放 RWS 以控制修补的鲁棒性强度;(3)可组合性,多个 RWS 可同时相加以一次性修补更全面的鲁棒性;(4)可迁移性,即使干净模型骨干被持续适配或更新,由于其杰出的跨数据集迁移性,RWS 仍作为有效补丁。

关键词

引用

@article{arxiv.2302.12480,
  title  = {Robust Weight Signatures: Gaining Robustness as Easy as Patching Weights?},
  author = {Ruisi Cai and Zhenyu Zhang and Zhangyang Wang},
  journal= {arXiv preprint arXiv:2302.12480},
  year   = {2023}
}