通过提示工程越狱ChatGPT:一项实证研究
软件工程
2024-03-12 v2 人工智能
计算与语言
摘要
大语言模型(LLMs),如ChatGPT,已展现出巨大潜力,但也带来了与内容限制和潜在滥用相关的挑战。我们的研究考察了三个关键研究问题:(1)可越狱LLMs的不同提示类型的数量,(2)越狱提示规避LLM限制的有效性,以及(3)ChatGPT对这些越狱提示的抵抗力。首先,我们开发了一个分类模型来分析现有提示的分布,识别出十种不同模式与三类越狱提示。随后,我们利用涵盖八个禁止场景的3120个越狱问题数据集,评估了提示对ChatGPT 3.5和4.0版本的越狱能力。最后,我们评估了ChatGPT对越狱提示的抵抗能力,发现这些提示在40个用例场景中能持续规避限制。该研究强调了提示结构在越狱LLMs中的重要性,并讨论了鲁棒越狱提示生成与防御的挑战。
引用
@article{arxiv.2305.13860,
title = {Jailbreaking ChatGPT via Prompt Engineering: An Empirical Study},
author = {Yi Liu and Gelei Deng and Zhengzi Xu and Yuekang Li and Yaowen Zheng and Ying Zhang and Lida Zhao and Tianwei Zhang and Kailong Wang and Yang Liu},
journal= {arXiv preprint arXiv:2305.13860},
year = {2024}
}