中文

黑盒机器翻译系统的模仿攻击与防御

计算与语言 2021-01-05 v3 密码学与安全 机器学习

摘要

攻击者可能试图窃取或攻击黑盒 NLP 系统,无论是为了经济利益还是利用模型错误。一个尤其受关注的场景是机器翻译(MT),其中模型具有高商业价值且错误代价高昂。我们研究了黑盒 MT 系统可能的漏洞利用,并探索针对此类威胁的初步防御。我们首先表明,可通过以单语句子查询 MT 系统并训练模型来模仿其输出,从而窃取 MT 系统。通过模拟实验,我们证明即使模仿模型与其目标模型具有不同的输入数据或架构,MT 模型窃取仍有可能。应用这些思路,我们训练的模仿模型在高资源与低资源语言对上均达到与三个生产级 MT 系统相差 0.6 BLEU 以内的表现。随后我们利用模仿模型的相似性将对抗样本迁移至生产系统。我们使用基于梯度的攻击,暴露出导致语义错误翻译、内容缺失以及粗俗模型输出的输入。为缓解这些漏洞,我们提出一种防御方法,通过修改翻译输出来误导模仿模型的优化。该防御以防御方一定的 BLEU 和推理速度为代价,降低了攻击方的 BLEU 分数与攻击成功率。

关键词

引用

@article{arxiv.2004.15015,
  title  = {Imitation Attacks and Defenses for Black-box Machine Translation Systems},
  author = {Eric Wallace and Mitchell Stern and Dawn Song},
  journal= {arXiv preprint arXiv:2004.15015},
  year   = {2021}
}

备注

EMNLP 2020