中文

[WIP] Jailbreak 悖论:大语言模型的阿基拉斯之 heel

计算与语言 2024-06-24 v2

摘要

我们提出了关于 foundation 模型越狱的两个悖论: 首先,无法构建完美的越狱分类器; 其次,较弱模型无法一致检测更强模型 (在 Pareto 主导意义上) 是否被越狱。我们提供了这些悖论的形式化证明,并简要案例研究于 Llama 和 GPT4-o 以示范。我们讨论了这些结果的更广理论和实际影响。

关键词

引用

@article{arxiv.2406.12702,
  title  = {[WIP] Jailbreak Paradox: The Achilles' Heel of LLMs},
  author = {Abhinav Rao and Monojit Choudhury and Somak Aditya},
  journal= {arXiv preprint arXiv:2406.12702},
  year   = {2024}
}