巨胀提示使大语言模型产生无意义输出
密码学与安全
2025-02-14 v2 人工智能
摘要
自回归大语言模型(LLM)在许多实际任务中取得了令人印象的性能,但这种新范式也暴露了新型威胁。本文探索了这些LLM对推理成本攻击的脆弱性,其中恶意用户设计巨胀提示(Engorgio prompts)以有意增加推理过程的计算成本和延迟。我们设计了Engorgio,一种新方法,高效生成对抗性巨胀提示以影响目标LLM的服务可用性。Engorgio具有以下两个技术贡献。(1) 我们采用参数化分布来跟踪LLM的预测轨迹。(2) 针对LLM推理过程的自回归特性,我们提出了新的损失函数,以稳定抑制<EOS>标记的出现,该标记会中断LLM的生成过程。我们在13个开源LLM(参数范围从125M到30B)上进行了广泛实验。结果表明,巨胀提示在白盒场景下成功诱导LLM生成异常长的输出(即大约2-13倍到达90%以上输出长度限制所需的时间),而我们实际的实验表明Engorgio对有限计算资源的LLM服务构成威胁。代码已发布于: https://github.com/jianshuod/Engorgio-prompt 。
引用
@article{arxiv.2412.19394,
title = {An Engorgio Prompt Makes Large Language Model Babble on},
author = {Jianshuo Dong and Ziyuan Zhang and Qingjie Zhang and Tianwei Zhang and Hao Wang and Hewu Li and Qi Li and Chao Zhang and Ke Xu and Han Qiu},
journal= {arXiv preprint arXiv:2412.19394},
year = {2025}
}
备注
ICLR 2025