中文

命名实体识别模型中的非预期记忆与计时攻击

密码学与安全 2022-11-07 v1 人工智能 机器学习

摘要

命名实体识别模型(NER)被广泛用于识别文本文档中的命名实体(例如个人、地点及其他信息)。基于机器学习的 NER 模型正日益应用于隐私敏感场景中,这些场景需要自动且可扩展地识别敏感信息以对文本进行编辑以供数据共享。在本文中,我们研究了 NER 模型作为黑盒服务用于识别用户文档中敏感信息的设定,并表明这些模型易受到针对其训练数据集的成员推断攻击。利用来自 spaCy 的更新后预训练 NER 模型,我们展示了针对这些模型的两种不同成员攻击。我们的第一种攻击利用了 NER 底层神经网络中的非预期记忆,这是已知神经网络易受影响的现象。我们的第二种攻击利用计时侧信道,以针对那些维护由训练数据构建的词表的 NER 模型。我们表明,训练数据集中词语与先前未出现词语在模型内部的不同功能路径在执行时间上存在可测量的差异。揭示训练样本的成员状态具有明显的隐私影响,例如在文本编辑中,待发现并移除的敏感词或短语面临在训练数据集中被检测到的风险。我们的实验评估包括密码与健康数据的编辑,呈现出安全风险与隐私/监管问题。仅使用单个短语即出现记忆现象的结果加剧了这一问题。我们在第一种攻击的文本编辑用例中达到了 70% 的 AUC。我们还展示了计时攻击的压倒性成功,AUC 达 99.23%。最后,我们讨论了鉴于成员推断攻击的隐私与安全影响,实现 NER 模型安全使用的潜在缓解方法。

关键词

引用

@article{arxiv.2211.02245,
  title  = {Unintended Memorization and Timing Attacks in Named Entity Recognition Models},
  author = {Rana Salal Ali and Benjamin Zi Hao Zhao and Hassan Jameel Asghar and Tham Nguyen and Ian David Wood and Dali Kaafar},
  journal= {arXiv preprint arXiv:2211.02245},
  year   = {2022}
}

备注

This is the full version of the paper with the same title accepted for publication in the Proceedings of the 23rd Privacy Enhancing Technologies Symposium, PETS 2023