揭示大语言模型的安全漏洞
计算与语言
2023-11-08 v1 人工智能
机器学习
摘要
随着大语言模型(LLM)日益普及,其可能产生有害或不恰当回复令人担忧。本文引入了一个独特的包含对抗性示例(以问题形式)的数据集,称之为 AttaQ,旨在诱发此类有害或不恰当的回复。我们通过分析各模型在该数据集下的漏洞来评估数据集的效力。此外,我们提出了一种新颖的自动方法,用于识别并命名脆弱语义区域——即模型可能产出有害输出的输入语义区域。这是通过应用专门的聚类技术实现的,该技术同时考虑输入攻击的语义相似性与模型回复的有害性。自动识别脆弱语义区域增强了对模型弱点的评估,有助于有针对性地改进其安全机制与整体可靠性。
引用
@article{arxiv.2311.04124,
title = {Unveiling Safety Vulnerabilities of Large Language Models},
author = {George Kour and Marcel Zalmanovici and Naama Zwerdling and Esther Goldbraich and Ora Nova Fandina and Ateret Anaby-Tavor and Orna Raz and Eitan Farchi},
journal= {arXiv preprint arXiv:2311.04124},
year = {2023}
}
备注
To be published in GEM workshop. Conference on Empirical Methods in Natural Language Processing (EMNLP). 2023