中文

面向大语言模型越狱的可解释 N-gram 概率威胁模型

计算与语言 2025-01-10 v1 人工智能 机器学习

摘要

已提出多种越狱攻击以获取安全调优 LLM 的有害响应。这些方法在其原始设置下大多成功地诱导目标输出,但其攻击在流畅性和计算 effort 上差异很大。本 work 提出了一个统一的威胁模型,用于原则性比较这些方法。我们的威胁模型检查给定的越狱是否可能出现在文本分布中。为此,我们在 1T tokens 上构建了一个 N-gram 语言模型,该模型不同于基于模型的 perplexity,允许 LLM 无关、非参数且本质上可解释的评估。我们将流行的攻击方法适应到该威胁模型中,并首次以该模型为基准对这些攻击进行公平比较。在广泛的比较后,我们发现针对安全调优的现代模型的攻击成功率低于之前呈现的水平,基于离散优化的攻击显著优于最近的 LLM-based 攻击。由于其本质上可解释,我们的威胁模型允许对越狱攻击进行全面分析和比较。我们发现有效攻击利用和滥用不常见的 bigrams,具体包括那些缺失于真实世界文本或罕见于 Reddit 或 code 数据集的 bigrams。

关键词

引用

@article{arxiv.2410.16221,
  title  = {On Creating an English-Thai Code-switched Machine Translation in Medical Domain},
  author = {Parinthapat Pengpun and Krittamate Tiankanon and Amrest Chinkamol and Jiramet Kinchagawat and Pitchaya Chairuengjitjaras and Pasit Supholkhan and Pubordee Aussavavirojekul and Chiraphat Boonnag and Kanyakorn Veerakanjana and Hirunkul Phimsiri and Boonthicha Sae-jia and Nattawach Sataudom and Piyalitt Ittichaiwong and Peerat Limkonchotiwat},
  journal= {arXiv preprint arXiv:2410.16221},
  year   = {2025}
}