中文

基于手工对抗样本评估预训练语言模型的脆弱性

计算与语言 2022-09-07 v1

摘要

大型语言模型发展的最新进展使得公众可以访问最先进的预训练语言模型(PLMs),包括生成式预训练Transformer 3(GPT-3)和来自Transformer的双向编码器表示(BERT)。然而,实践中对PLMs的评估显示它们在开发和微调阶段易受对抗攻击。此类攻击可导致错误输出、模型生成的仇恨言论以及用户敏感信息的泄露。虽然现有研究关注PLMs在训练或微调期间的对抗攻击,但关于这两个开发阶段之间所施加攻击的信息存在缺失。在本工作中,我们强调了GPT-3公开发布中的一个重大安全漏洞,并进一步在其他最先进PLMs中调查此漏洞。我们将工作限制在未经微调的预训练模型上。此外,我们强调令牌距离最小化的扰动作为一种有效的对抗方法,可绕过有监督和无监督的质量度量。遵循此方法,我们在语义相似性评估中观察到文本分类质量显著下降。

关键词

引用

@article{arxiv.2209.02128,
  title  = {Evaluating the Susceptibility of Pre-Trained Language Models via Handcrafted Adversarial Examples},
  author = {Hezekiah J. Branch and Jonathan Rodriguez Cefalu and Jeremy McHugh and Leyla Hujer and Aditya Bahl and Daniel del Castillo Iglesias and Ron Heichman and Ramesh Darwishi},
  journal= {arXiv preprint arXiv:2209.02128},
  year   = {2022}
}

备注

10 pages, 1 figure, 3 tables