置信度诱导:大型语言模型的一种新攻击向量
机器学习
2025-02-11 v2 计算与语言
密码学与安全
摘要
深度学习的一个根本性问题是对抗鲁棒性。随着这些系统规模的扩大,此类问题依然存在。目前,拥有数十亿参数的大型语言模型(LLMs)与其早期、较小的前身一样,遭受着对抗攻击。然而,威胁模型已经改变。以前,拥有灰盒访问权限(用户可以看到输入嵌入或输出logits/概率)可能是合理的。但是,随着闭源模型的引入,除了生成的输出之外,没有关于模型的任何信息可用。这意味着当前的黑盒攻击只能利用最终预测来判断攻击是否成功。在这项工作中,我们研究并展示了在分类任务中仅拥有黑盒访问权限时,类似于使用输出概率进行攻击引导的潜力。这是通过从模型中诱导出置信度的能力实现的。我们通过实验证明,对于当前的LLMs,诱导出的置信度是经过校准的,而非幻觉。因此,通过最小化诱导出的置信度,我们可以增加错误分类的可能性。我们提出的新范式在三个数据集上,针对两个模型(LLaMA-3-8B-Instruct和Mistral-7B-Instruct-V0.3),与现有的引入词级替换的硬标签黑盒攻击方法相比,展示了有前景的当前最优结果。
引用
@article{arxiv.2502.04643,
title = {Confidence Elicitation: A New Attack Vector for Large Language Models},
author = {Brian Formento and Chuan Sheng Foo and See-Kiong Ng},
journal= {arXiv preprint arXiv:2502.04643},
year = {2025}
}
备注
Published in ICLR 2025. The code is publicly available at https://github.com/Aniloid2/Confidence_Elicitation_Attacks