Learn2Weight:面向相似域对抗攻击的参数自适应防御
机器学习
2022-09-21 v2
摘要
近期自然语言处理(NLP)系统的黑盒对抗攻击工作引起了广泛关注。先前的黑盒攻击假设攻击者能基于所选输入观测目标模型的输出标签。受对抗可迁移性启发,本文提出一种新型黑盒 NLP 对抗攻击:攻击者可选择相似域并将对抗样本迁移至目标域,从而导致目标模型性能下降。基于域适应理论,我们进而提出一种称为 Learn2Weight 的防御策略,其通过训练来预测目标模型的权重调整,以防御相似域对抗样本的攻击。利用亚马逊多域情感分类数据集,我们实证表明,与对抗训练、防御性蒸馏等标准黑盒防御方法相比,Learn2Weight 对该攻击有效。本工作丰富了机器学习安全领域的文献。
引用
@article{arxiv.2205.07315,
title = {Learn2Weight: Parameter Adaptation against Similar-domain Adversarial Attacks},
author = {Siddhartha Datta},
journal= {arXiv preprint arXiv:2205.07315},
year = {2022}
}
备注
Accepted in COLING 2022