[WIP] Jailbreak 悖论:大语言模型的阿基拉斯之 heel
计算与语言
2024-06-24 v2
摘要
我们提出了关于 foundation 模型越狱的两个悖论: 首先,无法构建完美的越狱分类器; 其次,较弱模型无法一致检测更强模型 (在 Pareto 主导意义上) 是否被越狱。我们提供了这些悖论的形式化证明,并简要案例研究于 Llama 和 GPT4-o 以示范。我们讨论了这些结果的更广理论和实际影响。
引用
@article{arxiv.2406.12702,
title = {[WIP] Jailbreak Paradox: The Achilles' Heel of LLMs},
author = {Abhinav Rao and Monojit Choudhury and Somak Aditya},
journal= {arXiv preprint arXiv:2406.12702},
year = {2024}
}