中文

预训练语言模型的威胁:综述与分类

密码学与安全 2022-02-15 v1

摘要

预训练语言模型(PTLMs)在广泛的自然语言处理(NLP)任务上取得了巨大成功和卓越性能。然而,关于采用 PTLMs 的潜在安全问题也引发了越来越多的担忧。在本综述中,我们全面系统化了近期发现的针对 PTLM 系统与应用的威胁。我们从三个有趣的视角进行攻击刻画。(1)我们表明威胁可由不同恶意实体在 PTLM 流水线的不同阶段引发。(2)我们识别出两类促进攻击的模型可迁移性(landscape、portrait)。(3)基于攻击目标,我们总结了四类攻击(后门、规避、数据隐私和模型隐私)。我们还讨论了一些开放问题和研究方向。我们相信我们的综述与分类将启发未来朝向安全且隐私保护的 PTLMs 的研究。

关键词

引用

@article{arxiv.2202.06862,
  title  = {Threats to Pre-trained Language Models: Survey and Taxonomy},
  author = {Shangwei Guo and Chunlong Xie and Jiwei Li and Lingjuan Lyu and Tianwei Zhang},
  journal= {arXiv preprint arXiv:2202.06862},
  year   = {2022}
}