中文

如何以更好的一致性注入后门:基于干净数据的对数锚定

机器学习 2022-03-03 v2 密码学与安全

摘要

由于从零开始训练大规模后门模型需要大型训练数据集,近期的若干攻击方法考虑将后门注入已训练好的干净模型中,而不改变其在干净数据上的模型行为。先前工作发现,后门可通过对抗权重扰动(AWP)注入已训练好的干净模型。此处AWP指在后门学习中较小的参数变化。本工作中,我们观察到一种有趣现象:在微调已训练干净模型以注入后门时,参数的变化总是AWPs。我们进一步提供理论分析解释该现象。我们将在干净数据上保持准确率的行为表述为后门模型的一致性,包括全局一致性与实例级一致性。我们广泛分析了AWPs对后门模型一致性的影响。为获得更好的一致性,我们提出一种新颖的锚定损失,以锚定或冻结模型在干净数据上的行为,并具有理论保证。分析与实验结果均验证了该锚定损失在提升一致性(尤其是实例级一致性)方面的有效性。

关键词

引用

@article{arxiv.2109.01300,
  title  = {How to Inject Backdoors with Better Consistency: Logit Anchoring on Clean Data},
  author = {Zhiyuan Zhang and Lingjuan Lyu and Weiqiang Wang and Lichao Sun and Xu Sun},
  journal= {arXiv preprint arXiv:2109.01300},
  year   = {2022}
}

备注

Accepted by ICLR 2022