中文

揭示大语言模型的安全漏洞

计算与语言 2023-11-08 v1 人工智能 机器学习

摘要

随着大语言模型(LLM)日益普及,其可能产生有害或不恰当回复令人担忧。本文引入了一个独特的包含对抗性示例(以问题形式)的数据集,称之为 AttaQ,旨在诱发此类有害或不恰当的回复。我们通过分析各模型在该数据集下的漏洞来评估数据集的效力。此外,我们提出了一种新颖的自动方法,用于识别并命名脆弱语义区域——即模型可能产出有害输出的输入语义区域。这是通过应用专门的聚类技术实现的,该技术同时考虑输入攻击的语义相似性与模型回复的有害性。自动识别脆弱语义区域增强了对模型弱点的评估,有助于有针对性地改进其安全机制与整体可靠性。

关键词

引用

@article{arxiv.2311.04124,
  title  = {Unveiling Safety Vulnerabilities of Large Language Models},
  author = {George Kour and Marcel Zalmanovici and Naama Zwerdling and Esther Goldbraich and Ora Nova Fandina and Ateret Anaby-Tavor and Orna Raz and Eitan Farchi},
  journal= {arXiv preprint arXiv:2311.04124},
  year   = {2023}
}

备注

To be published in GEM workshop. Conference on Empirical Methods in Natural Language Processing (EMNLP). 2023