隐于无形:探索交互式语言模型中的聊天历史篡改
人工智能
2024-09-09 v3
摘要
大型语言模型(LLM),如ChatGPT和Llama,已在现实世界应用中变得普遍,展现出令人印象深刻的文本生成性能。LLM从根本上是从输入数据保持静态且非结构化的场景发展而来的。为了实现交互,基于LLM的聊天系统必须将先前的聊天历史作为上下文,按照预定义的结构整合到其输入中。然而,LLM无法将用户输入与上下文区分开,这使得聊天历史篡改成为可能。本文引入了一种系统性的方法,可以在对目标模型没有任何先验知识的情况下,将用户提供的历史注入到LLM对话中。关键在于利用能够良好组织待注入消息的提示模板,引导目标LLM将其解释为真实的聊天历史。为了在WebUI黑盒设置中自动搜索有效模板,我们提出了LLM引导的遗传算法(LLMGA),该算法利用LLM生成并迭代优化模板。我们将所提出的方法应用于流行的现实世界LLM,包括ChatGPT和Llama-2/3。结果表明,聊天历史篡改可以增强模型行为随时间的可塑性,并极大地影响模型输出。例如,在ChatGPT上,它可以将禁止响应诱导的成功率提高到97%。我们的研究结果为交互式LLM在现实世界部署中面临的挑战提供了见解。
引用
@article{arxiv.2405.20234,
title = {Hidden in Plain Sight: Exploring Chat History Tampering in Interactive Language Models},
author = {Cheng'an Wei and Yue Zhao and Yujia Gong and Kai Chen and Lu Xiang and Shenchen Zhu},
journal= {arXiv preprint arXiv:2405.20234},
year = {2024}
}