中文

Genshin:面向自然语言处理的大语言模型通用防护盾

计算与语言 2024-06-04 v2 人工智能

摘要

近期,像ChatGPT、Gemini或LLaMA这样的大语言模型(LLMs)显示出在诸多领域的显著进步和广泛适应性。然而,LLMs制造了一个更大的黑箱,加剧了不透明性,其可解释性仅限于少数方法。LLMs固有的不确定性和不透明性限制了其在诸如金融欺诈、网络钓鱼等高风险领域的应用。当前方法主要依赖传统文本分类配合后置可解释算法,受攻击者可能创建多样化对抗样本以破坏系统防御的限制,迫使用户在效率和鲁棒性之间做出权衡。为此,本文提出一种名为Genshin(General Shield for Natural Language Processing with Large Language Models)的新型级联框架,利用LLMs作为一次性插件进行防御。不同于大多数LLMs应用试图将文本转化为新内容或结构化形式,Genshin使用LLMs恢复文本到其原始状态。Genshin旨在结合LLM的通用性、中间模型的判别能力以及简单模型的可解释性。我们在情感分析和垃圾邮件检测任务上的实验表明,当前中间模型存在致命缺陷,而LLMs的恢复能力却表现出色,表明Genshin在有效性和效率方面都表现出色。在我们的消融研究中,我们发现了一些有趣的观察。利用LLM防御器——一种源自第四范式的工具,我们在NLP第三个范式中复现了BERT的15%最优mask rate结果。此外,当采用LLM作为潜在攻击工具时,攻击者能够执行几乎语义无损的有效攻击。

关键词

引用

@article{arxiv.2405.18741,
  title  = {Genshin: General Shield for Natural Language Processing with Large Language Models},
  author = {Xiao Peng and Tao Liu and Ying Wang},
  journal= {arXiv preprint arXiv:2405.18741},
  year   = {2024}
}