通过多语言提问全面评估ChatGPT的可靠性
软件工程
2023-12-19 v1
摘要
ChatGPT是目前最受欢迎的大型语言模型(LLM),拥有超过1亿用户,对人们的生活产生了重大影响。然而,由于越狱漏洞的存在,ChatGPT可能对人们的生活产生负面影响,甚至可能为犯罪活动提供便利。测试ChatGPT是否会导致越狱至关重要,因为这可以增强ChatGPT的安全性、可靠性和社会责任。受先前研究揭示LLM在不同语言翻译中表现各异的启发,我们怀疑用多种语言包装提示词可能会导致ChatGPT越狱。为了调查这一点,我们设计了一项研究,采用模糊测试方法来分析ChatGPT的跨语言能力。我们的研究包含三种策略,通过自动向ChatGPT提出不同格式的恶意问题:(1)每个恶意问题仅涉及一种语言,(2)多语言恶意问题,(3)指定ChatGPT以与提示词不同的语言进行回复。此外,我们还利用提示词注入模板包装上述三类问题,从而结合了我们的策略。我们总共检查了7,892个问答数据点,发现多语言包装确实能导致ChatGPT越狱,且不同的包装方法对越狱概率有不同的影响。提示词注入可以放大多语言包装导致的越狱概率。这项工作为OpenAI开发者增强ChatGPT对语言多样性和包容性的支持提供了见解。
引用
@article{arxiv.2312.10524,
title = {Comprehensive Evaluation of ChatGPT Reliability Through Multilingual Inquiries},
author = {Poorna Chander Reddy Puttaparthi and Soham Sanjay Deo and Hakan Gul and Yiming Tang and Weiyi Shang and Zhe Yu},
journal= {arXiv preprint arXiv:2312.10524},
year = {2023}
}
备注
10 pages, conference paper