自然语言理解模型中的金丝雀提取
计算与语言
2022-03-29 v1 人工智能
信息检索
机器学习
摘要
自然语言理解(NLU)模型可以在敏感信息(如电话号码、邮政编码等)上进行训练。近期文献聚焦于能够从模型参数中提取训练数据的模型逆向攻击(ModIvA)。在这项工作中,我们提出了此类攻击的一个版本,通过提取插入NLU训练数据中的金丝雀(canaries)来实现。在该攻击中,具有开放盒(open-box)访问权限的对手重建模型训练集中包含的金丝雀。我们通过针对金丝雀执行文本补全来评估我们的方法,并证明通过使用金丝雀的前缀(非敏感)词元,我们可以生成完整的金丝雀。例如,我们的攻击能够在最佳配置下以0.5的概率重建NLU模型训练数据集中的四位数字代码。作为对策,我们确定了几种防御机制,它们结合后在我们的实验中有效消除了ModIvA的风险。
引用
@article{arxiv.2203.13920,
title = {Canary Extraction in Natural Language Understanding Models},
author = {Rahil Parikh and Christophe Dupuy and Rahul Gupta},
journal= {arXiv preprint arXiv:2203.13920},
year = {2022}
}
备注
Accepted to ACL 2022, Main Conference