中文

通过询问方向对 LLM 输出进行黑盒优化

密码学与安全 2025-10-21 v1 机器学习

摘要

我们提出了一种新颖的攻击方法,用于对黑盒大语言模型(LLM)进行攻击,利用其在自然语言中表达置信度的能力。现有的黑盒攻击要么需要访问连续模型输出如 logits 或置信度分数(实际中很少提供),要么依赖来自其他模型的代理信号。相反,我们演示了如何通过提示 LLM 以方式表达其内部置信度,使其足够校准,以实现有效的对抗优化。我们将这一通用方法应用于三个攻击场景:针对视觉-LLM 的对抗样本、jailbreaks 与 prompt injections。我们的攻击成功生成针对仅暴露文本输出的系统的恶意输入,从而大幅扩大了部署 LLM 的攻击面。我们进一步发现,更好的更大的模型在表达置信度时表现出更好的校准,这导致令人担忧的安全悖论:模型能力的提升直接增强了漏洞性。我们的代码已提供链接 [link](https://github.com/zj-jayzhang/black_box_llm_optimization)。

关键词

引用

@article{arxiv.2510.16794,
  title  = {Black-box Optimization of LLM Outputs by Asking for Directions},
  author = {Jie Zhang and Meng Ding and Yang Liu and Jue Hong and Florian Tramèr},
  journal= {arXiv preprint arXiv:2510.16794},
  year   = {2025}
}