非标准 Unicode 字符对大语言模型安全性和理解的影响
计算与语言
2024-05-24 v1
摘要
大型语言模型的发展显著提升了自然语言处理能力。然而,诸如越狱(导致LLM遵循与其原意相反的指令的提示注入)、幻觉(生成错误或误导性信息)和理解错误等挑战仍然普遍存在。本报告中,我们对十五个不同模型进行了比较分析,每个模型都经过标准化测试,包括38个查询,涵盖三个关键指标:越狱、幻觉和理解错误。根据越狱、幻觉和理解错误的总发生次数对这些模型进行评估。我们的工作揭示了这些模型的内在漏洞,并挑战了这些模型在人类水平语言理解方面的观念。我们经验性地分析了非标准 Unicode 字符对LLM及其保护机制的影响,研究对象包括最佳表现的GPT-4、Gemini 1.5 Pro、LlaMA-3-70B和Claude 3 Opus。通过纳入Unicode标准拉丁字符块之外的字母数字符号以及其他语言中字符的变体,我们观察到通过强化学习人类反馈(RLHF)实施的警戒措施的有效性降低。Consequently,这些模型对内容政策违规和提示泄露更容易受到威胁。我们的研究还表明,需要将非标准 Unicode 文本纳入LLM训练数据以增强这些模型的能力。
引用
@article{arxiv.2405.14490,
title = {Impact of Non-Standard Unicode Characters on Security and Comprehension in Large Language Models},
author = {Johan S Daniel and Anand Pal},
journal= {arXiv preprint arXiv:2405.14490},
year = {2024}
}
备注
46 pages